Skip to main content
PRODUCT 2

PDFlib: TET Overview


PDFlib TET 6 – Text and Image Extraction Toolkit

PDFlib TET는 어떤 제품인가요?

PDFlib TET(텍스트 및 이미지 추출 툴킷)는 PDF 문서에서 텍스트, 이미지, 주석 및 메타데이터를 신뢰성 있게 추출합니다. TET는 PDF의 텍스트 내용을 유니코드 문자열로 제공하며, 상세한 색상, 글리프(glyph), 글꼴 정보와 페이지 내 위치도 제공합니다. 래스터 이미지는 일반적인 이미지 형식으로 추출되며, TET는 PDF 문서를 텍스트와 메타데이터, 자원 정보를 포함하는 XML 기반 형식의 TETML로 변환하여 선택적으로 제공합니다. TET는 단어 경계(word boundaries) 결정, 텍스트 열별 그룹화(grouping text into columns), 테이블 구조 식별, 그림자 텍스트(shadow text)와 같은 중복 항목 제거를 위한 고급 콘텐츠 분석 알고리즘을 사용합니다.

PDFlib TET에는 다음과 같은 기능이 있습니다 :

  • 검색 엔진용 PDF Indexer 구현
  • PDF에서 텍스트와 이미지 재활용
  • PDF 내용을 다른 형식으로 변환
  • PDF를 내용에 따라 처리. 예를 들어, 제목에 따른 분할(TET 외에도 PDFlib+PDI가 필요합니다) 기능이 있습니다.
  • 바코드나 도장을 붙이는 등 페이지의 특정 위치가 비어 있는지 확인
  • TET는 또한 문서 정보 필드, XMP 메타데이터, 글꼴 목록, 페이지 크기 등 PDF 문서에 대한 세부 정보를 조회할 수 있는 pCOS 인터페이스도 포함합니다(pCOS 제품 설명 및 pCOS Cookbook 참조)

TET 제품군

TET에는 다음과 같은 제품이 있습니다 :

  • 텍스트 및 이미지 추출 툴킷(TET)은 PDF에서 텍스트, 이미지, 메타데이터 및 기타 요소를 추출하는 핵심 제품입니다.
  • TET PDF IFilter는 PDF 문서에서 텍스트와 메타데이터를 추출하기에 Windows에서 검색 및 검색 소프트웨어를 사용할 수 있습니다. 별도의 제품으로 제공되며, Windows 검색, SharePoint, SQL Server와 같은 Microsoft 검색 제품과 함께 사용할 수 있습니다.
  • Adobe Acrobat용 TET Plugin은 PDF에서 텍스트와 이미지를 추출하는 무료 유틸리티입니다. TET를 인터랙티브하게 평가하는 데 사용할 수 있습니다.

TET 추가 정보