검색 가능한 PDF 만드는 방법
스캔 PDF는 종이의 사진입니다 — 파일에 텍스트가 없고 픽셀만 있습니다. 검색, 선택, 복사 또는 스크린 리더 사용을 할 수 없습니다. 검색 가능하게 만드는 것은 OCR(광학 문자 인식)을 실행하여 이미지 뒤에 텍스트 레이어를 추가하는 것입니다. 이 가이드는 세 가지 OCR 출력 유형, 이를 잘 수행하는 로컬 도구, 그리고 IXPDF가 오늘 브라우저에서 OCR을 하지 않는 이유를 다룹니다.
세 가지 OCR 출력 유형
OCR 도구는 세 가지 다른 출력 유형을 생성할 수 있습니다. 어느 것을 원하는지는 결과로 무엇을 할 것인지에 달려 있습니다.
1. 검색 가능 PDF (이미지 + 보이지 않는 텍스트)
가장 흔하고 일반적으로 올바른 선택. 원본 페이지 이미지가 그대로 보입니다 — 레이아웃, 서명, 도장, 손글씨가 이전과 정확히 같이 나타납니다. 이미지 뒤에 OCR이 인식된 문자로 보이지 않는 텍스트 레이어를 추가합니다. 검색, 선택, 복사 및 스크린 리더 사용이 가능합니다; 화면에 보이는 것은 원본 스캔입니다. Adobe Acrobat, Tesseract 및 ABBYY가 기본으로 생성하는 것입니다.
적합: 원본 외형이 중요한 스캔 문서 보관(계약서, 영수증, 서명된 편지).
2. 텍스트만 PDF (인식된 텍스트, 이미지 없음)
OCR이 이미지를 완전히 인식된 텍스트로 대체합니다. 결과는 작고, 완전히 선택 가능하며, 일반 텍스트 PDF처럼 보입니다 — 하지만 원본 레이아웃은 근사이며, OCR이 인식하지 못한 콘텐츠(서명, 도장, 손글씨)는 사라졌습니다.
적합: 텍스트만 필요하고 원본 외형이 중요하지 않을 때 (예: 스캔된 편지의 본문을 지식 베이스용 검색 가능 파일로 추출).
3. 이중 레이어 PDF (이미지 + 텍스트, 둘 다 보임)
덜 흔한 형식으로, 원본 이미지와 인식된 텍스트를 나란히 보여주거나, 이미지를 희미하게 하고 그 위에 텍스트를 겹쳐 보여줍니다. 법적 및 보관 흐름에서 검토자가 인식 오류를 감지하기 위해 OCR 출력을 원본과 비교해야 할 때 사용됩니다. ABBYY FineReader와 Adobe Acrobat Pro가 지원합니다.
적합: 법적 교정, 보관 품질 관리, OCR 정확도를 원본과 비교해야 하는 모든 흐름.
로컬 OCR 도구
아래의 각 도구는 기기에서 실행됩니다. 어느 것도 문서를 업로드하지 않습니다. 이것은 중요합니다: 스캔된 계약서, 의료 기록 또는 세금 양식은 "무료 온라인 OCR" 서비스로 보내지 않아야 합니다 — 그 시점에서 콘텐츠가 누군가의 서버에 있습니다.
1. Adobe Acrobat Pro (유료, 황금 표준)
스캔 PDF를 열고, 도구 > 스캔 및 OCR > 텍스트 인식 > 이 파일 에서. 언어와 출력 유형을 선택하세요(검색 가능 이미지가 기본이며 일반적으로 올바름). Acrobat의 OCR은 실제 스캔에서 가장 정확하고, 다중 열 레이아웃을 잘 처리하며, 잘못 인식된 단어를 인라인으로 교정할 수 있습니다. 단점은 비용입니다 — Acrobat Pro는 구독입니다.
2. Tesseract (무료, 오픈소스, 명령줄)
가장 정확한 무료 OCR 엔진. Tesseract GitHub 프로젝트에서 또는 패키지 관리자(brew install tesseract macOS,apt install tesseract-ocr Linux)에서 설치하세요. 그 후:
tesseract input.pdf output -l eng pdf
이는 output.pdf를 원본 이미지와 보이지 않는 영어 텍스트 레이어가 있는 검색 가능 PDF로 생성합니다. Tesseract는 복잡한 레이아웃에서 Acrobat만큼 정확하지 않지만, 깨끗한 단일 열 스캔에서 훌륭합니다. 100개 이상의 언어를 지원합니다 — 혼합 영어/프랑스어 문서의 경우 -l eng+fra를 전달하세요.
3. macOS의 Preview Live Text (무료, macOS 12+)
macOS Monterey 이상에서 Preview는 시스템의 Live Text 기능을 통해 스캔 PDF 및 이미지의 텍스트를 인식할 수 있습니다. Preview에서 PDF를 열면 텍스트를 직접 선택, 복사 및 검색할 수 있습니다 — macOS가 즉석에서 텍스트 레이어를 추가합니다. 검색 가능 버전을 저장하려면 파일 > PDF로 내보내기. Live Text는 빠르고 영어 문서에서 정확하지만 Tesseract에 비해 언어 지원이 제한적입니다.
4. ABBYY FineReader (유료, 고정밀)
어려운 스캔 — 손글씨, 저대비, 혼합 글꼴, 다중 열 레이아웃 — 에서 고정밀로 알려진 상용 OCR 도구. 검증을 위한 이중 레이어 출력을 지원합니다. Tesseract가 충분히 정확하지 않고 Acrobat Pro 구독을 정당화할 수 없을 때 사용하세요. FineReader는 일회성 구매이지 구독이 아닙니다.
단계별: Tesseract로 검색 가능 PDF 만들기
- Tesseract 설치. macOS에서
brew install tesseract. Linux에서apt install tesseract-ocr. Windows에서 Tesseract GitHub 프로젝트에서 설치 프로그램을 다운로드하세요. - 언어 데이터 설치. 영어가 기본으로 포함됩니다. 다른 언어의 경우 해당 언어 팩을 설치하세요 (예: macOS에서
brew install tesseract-lang). - 터미널 열기. 스캔 PDF가 있는 폴더로 이동하세요.
- OCR 실행.
tesseract input.pdf output -l eng pdf - 결과 확인.
output.pdf를 열고, 이미지에서 보이는 단어를 검색하고 문단을 선택해 보세요. 검색과 선택이 작동하면 텍스트 레이어가 있습니다. - 교정. OCR은 실수를 합니다. 문단을 텍스트 편집기에 복사하여 이미지와 비교하세요. 텍스트를 신뢰할 계획이라면 중요한 오인식을 원본 문서에서 교정하세요.
OCR 정확도: 기대할 것
OCR 정확도는 거의 전적으로 원본 이미지 품질에 달려 있습니다. 일반 글꼴(Arial, Times New Roman)로 인쇄된 페이지의 깨끗한 300 DPI 스캔은 98–99% 문자 정확도로 인식됩니다. 장식 글꼴의 복사된 페이지의 150 DPI 스캔은 90% 이하로 떨어질 수 있습니다 — 10글자당 1글자 오류로, 검색과 복사-붙여넣기를 망치기에 충분합니다.
정확도를 해치는 것: 저해상도(200 DPI 미만), 기울어짐(각도진 스캔 페이지), 노이즈(더러운 스캐너 유리의 얼룩), 혼합 글꼴, 손글씨, 다중 열 레이아웃, 표, 색 배경 위의 텍스트. 스캔에 이 중 하나라도 있으면 주의 깊게 교정할 것으로 기대하세요.
흔한 실수
- 민감한 문서에 무료 온라인 OCR 서비스 사용. 파일이 서버로 업로드됩니다. 로컬 도구 — Tesseract, Acrobat 또는 macOS Live Text — 를 사용하세요.
- 교정 없이 OCR 출력 신뢰. OCR은 실수를 합니다. 계약서, 인용구 또는 데이터베이스에 텍스트를 복사한다면 각 단어를 이미지와 대조하여 확인하세요.
- 원본 외형이 필요한데 텍스트만 출력 선택. 텍스트만 OCR은 이미지를 버립니다. 서명, 도장 또는 레이아웃이 중요하면 검색 가능 PDF 출력을 대신 사용하세요.
- 이미 텍스트가 있는 PDF에 OCR 실행. 파일에 이미 텍스트 레이어가 있다면(Ctrl+F로 테스트) OCR이 불필요하며 기존 텍스트를 저하할 수 있습니다. 파일이 정말 OCR이 필요한지 확인하려면PDF에서 텍스트를 선택할 수 없는 이유를 참조하세요.
- 언어 팩 생략. Tesseract는 영어를 기본으로 사용합니다. 영어 모델로 프랑스어 문서를 OCR하면 쓰레기가 나옵니다. 항상 올바른 언어로
-l을 전달하세요.
검색 가능 PDF의 메타데이터 편집하세요
OCR이 텍스트 레이어를 추가한 후, IXPDF의 메타데이터 편집 도구로 제목, 저자, 주제, 키워드를 설정하세요 — 브라우저에서 로컬로, 업로드 없이.
메타데이터 편집 열기