如何使 PDF 可搜索
扫描 PDF 是纸张的照片 — 文件中没有文本,只有像素。您无法搜索、选择、复制或对其使用 屏幕阅读器。使其可搜索意味着运行 OCR(光学字符识别)来添加位于图像背后的文本层。本指南 涵盖三种 OCR 输出类型、能做好此事的本地工具,以及为什么 IXPDF 今天不在浏览器中做 OCR。
三种 OCR 输出类型
OCR 工具可以产生三种不同的输出。您想要哪种取决于您要用结果做什么。
1. 可搜索 PDF(图像 + 不可见文本)
最常见且通常是正确的选择。原始页面图像保持可见 — 布局、签名、印章、手写都和原来 完全一样。在图像背后,OCR 添加一个不可见文本层包含识别的字符。您可以搜索、选择、 复制和使用屏幕阅读器;屏幕上看到的是原始扫描。这是 Adobe Acrobat、Tesseract 和 ABBYY 默认产生的。
最适合: 归档原始外观重要的扫描文档(合同、收据、签署的信件)。
2. 纯文本 PDF(识别的文本,无图像)
OCR 用识别的文本完全替换图像。结果文件小、完全可选择、看起来像普通文本 PDF — 但 原始布局是近似的,OCR 无法识别的任何内容(签名、印章、手写)都消失了。
最适合: 您只需要文本且原始外观不重要时 (例如将扫描信件的正文提取为知识库的可搜索文件)。
3. 双层 PDF(图像 + 文本,两者都可见)
一种较少见的格式,将原始图像和识别文本并排显示,或将文本叠加在图像上并使图像淡化。 用于需要将 OCR 输出与原始对比以捕捉误读的法律和归档工作流。ABBYY FineReader 和 Adobe Acrobat Pro 支持此格式。
最适合: 法律审查、归档质量控制、任何需要对照源文件验证 OCR 准确度 的工作流。
本地 OCR 工具
以下每个工具都在您的机器上运行。它们都不上传您的文档。这很重要:扫描的合同、病历或 税表不应发送到"免费在线 OCR"服务 — 那时内容已在别人的服务器上。
1. Adobe Acrobat Pro(付费,黄金标准)
打开扫描的 PDF,然后 工具 > 扫描 & OCR > 识别文本 > 在此文件中。 选择语言和输出类型(可搜索图像是默认值且通常正确)。Acrobat 的 OCR 对真实世界扫描 最准确,能很好地处理多栏布局,并允许您内联纠正误识别的单词。缺点是成本 — Acrobat Pro 是订阅制。
2. Tesseract(免费,开源,命令行)
最准确的免费 OCR 引擎。从 Tesseract GitHub 项目或您的包管理器安装 (macOS 上 brew install tesseract,Linux 上 apt install tesseract-ocr)。然后:
tesseract input.pdf output -l eng pdf
这会生成 output.pdf 作为可搜索 PDF,包含原始图像和不可见的英文文本层。 Tesseract 在复杂布局上不如 Acrobat 准确,但在干净的単栏扫描上表现出色。它支持 100 多种 语言 — 对英/法混排文档传入 -l eng+fra。
3. macOS Preview Live Text(免费,macOS 12+)
在 macOS Monterey 及更高版本上,Preview 可以使用系统的 Live Text 功能识别扫描 PDF 和图像中的文本。在 Preview 中打开 PDF,您可以直接选择、复制和搜索文本 — macOS 即时 添加文本层。要保存可搜索版本,文件 > 导出为 PDF。Live Text 对英文文档 快速且准确,但与 Tesseract 相比语言支持有限。
4. ABBYY FineReader(付费,高准确度)
以对困难扫描 — 手写、低对比度、混合字体、多栏布局 — 的高准确度而闻名的商用 OCR 工具。 它支持双层输出用于验证。当 Tesseract 不够准确且您无法证明 Acrobat Pro 订阅合理时使用。 FineReader 是一次性购买,不是订阅。
分步说明:用 Tesseract 使 PDF 可搜索
- 安装 Tesseract。 macOS 上
brew install tesseract。 Linux 上apt install tesseract-ocr。Windows 上从 Tesseract GitHub 项目 下载安装程序。 - 安装语言数据。 英文默认包含。对其他语言,安装匹配的语言包 (例如 macOS 上
brew install tesseract-lang)。 - 打开终端。 导航到包含扫描 PDF 的文件夹。
- 运行 OCR。
tesseract input.pdf output -l eng pdf - 检查结果。 打开
output.pdf,搜索一个您在图像中能看到的 词,并尝试选择一段文字。如果搜索和选择都能工作,文本层已就位。 - 校对。 OCR 会误读。将一段文字复制到文本编辑器中并与图像对比。如果 您将依赖文本,在源文档中修正任何关键误识别。
OCR 准确度:预期
OCR 准确度几乎完全取决于源图像的质量。常见字体(Arial、Times New Roman)的印刷页面 干净 300 DPI 扫描可达到 98–99% 的字符准确度。装饰字体的影印页面 150 DPI 扫描可能 降至 90% 或更低 — 即 10 个字符中有 1 个错误,足以破坏搜索和复制粘贴。
损害准确度的因素:低分辨率(低于 200 DPI)、倾斜(以角度扫描的页面)、噪点 (脏扫描仪玻璃产生的斑点)、混合字体、手写、多栏布局、表格以及彩色背景上的文本。 如果您的扫描有以上任何一项,请预期需要仔细校对。
常见错误
- 对敏感文档使用免费在线 OCR 服务。文件被上传到服务器。使用本地工具 — Tesseract、Acrobat 或 macOS Live Text。
- 不校对就信任 OCR 输出。OCR 会误读。如果您将文本复制到合同、引用或数据库中,请对照图像验证每个词。
- 需要原始外观时选择纯文本输出。纯文本 OCR 丢弃图像。如果签名、印章或布局重要,请改用可搜索 PDF 输出。
- 对已有文本的 PDF 做 OCR。如果文件已有文本层(用 Ctrl+F 测试),OCR 是不必要的且可能劣化现有文本。参见为什么我无法在 PDF 中选择文本?确认文件确实需要 OCR。
- 跳过语言包。Tesseract 默认英文。用英文语言模型对法语文档做 OCR 会产生垃圾。始终用正确语言 传入
-l。