跳至内容
100% 本地 · 上传 0 KB压缩 PDF

如何使 PDF 可搜索

🔒 您的文件永不离开您的设备。所有处理均在浏览器本地完成。

扫描 PDF 是纸张的照片 — 文件中没有文本,只有像素。您无法搜索、选择、复制或对其使用 屏幕阅读器。使其可搜索意味着运行 OCR(光学字符识别)来添加位于图像背后的文本层。本指南 涵盖三种 OCR 输出类型、能做好此事的本地工具,以及为什么 IXPDF 今天不在浏览器中做 OCR。

IXPDF 今天无法在浏览器中做 OCR
浏览器 OCR 引擎(Tesseract.js、OCRad.js)存在,但它们对真实世界扫描的准确度不够可靠, 不适合发布。它们误读常见字体,难以处理多栏布局,产生的文本对搜索和无障碍来说比没有文本 更糟。我们不会发布一个悄悄返回错误文本的工具(AGENTS.md §16)。这被标记为Research Required。以下工具在您的机器上本地运行,不上传您的文件。

三种 OCR 输出类型

OCR 工具可以产生三种不同的输出。您想要哪种取决于您要用结果做什么。

1. 可搜索 PDF(图像 + 不可见文本)

最常见且通常是正确的选择。原始页面图像保持可见 — 布局、签名、印章、手写都和原来 完全一样。在图像背后,OCR 添加一个不可见文本层包含识别的字符。您可以搜索、选择、 复制和使用屏幕阅读器;屏幕上看到的是原始扫描。这是 Adobe Acrobat、Tesseract 和 ABBYY 默认产生的。

最适合: 归档原始外观重要的扫描文档(合同、收据、签署的信件)。

2. 纯文本 PDF(识别的文本,无图像)

OCR 用识别的文本完全替换图像。结果文件小、完全可选择、看起来像普通文本 PDF — 但 原始布局是近似的,OCR 无法识别的任何内容(签名、印章、手写)都消失了。

最适合: 您只需要文本且原始外观不重要时 (例如将扫描信件的正文提取为知识库的可搜索文件)。

3. 双层 PDF(图像 + 文本,两者都可见)

一种较少见的格式,将原始图像和识别文本并排显示,或将文本叠加在图像上并使图像淡化。 用于需要将 OCR 输出与原始对比以捕捉误读的法律和归档工作流。ABBYY FineReader 和 Adobe Acrobat Pro 支持此格式。

最适合: 法律审查、归档质量控制、任何需要对照源文件验证 OCR 准确度 的工作流。

本地 OCR 工具

以下每个工具都在您的机器上运行。它们都不上传您的文档。这很重要:扫描的合同、病历或 税表不应发送到"免费在线 OCR"服务 — 那时内容已在别人的服务器上。

1. Adobe Acrobat Pro(付费,黄金标准)

打开扫描的 PDF,然后 工具 > 扫描 & OCR > 识别文本 > 在此文件中。 选择语言和输出类型(可搜索图像是默认值且通常正确)。Acrobat 的 OCR 对真实世界扫描 最准确,能很好地处理多栏布局,并允许您内联纠正误识别的单词。缺点是成本 — Acrobat Pro 是订阅制。

2. Tesseract(免费,开源,命令行)

最准确的免费 OCR 引擎。从 Tesseract GitHub 项目或您的包管理器安装 (macOS 上 brew install tesseract,Linux 上 apt install tesseract-ocr)。然后:

tesseract input.pdf output -l eng pdf

这会生成 output.pdf 作为可搜索 PDF,包含原始图像和不可见的英文文本层。 Tesseract 在复杂布局上不如 Acrobat 准确,但在干净的単栏扫描上表现出色。它支持 100 多种 语言 — 对英/法混排文档传入 -l eng+fra。

3. macOS Preview Live Text(免费,macOS 12+)

在 macOS Monterey 及更高版本上,Preview 可以使用系统的 Live Text 功能识别扫描 PDF 和图像中的文本。在 Preview 中打开 PDF,您可以直接选择、复制和搜索文本 — macOS 即时 添加文本层。要保存可搜索版本,文件 > 导出为 PDF。Live Text 对英文文档 快速且准确,但与 Tesseract 相比语言支持有限。

4. ABBYY FineReader(付费,高准确度)

以对困难扫描 — 手写、低对比度、混合字体、多栏布局 — 的高准确度而闻名的商用 OCR 工具。 它支持双层输出用于验证。当 Tesseract 不够准确且您无法证明 Acrobat Pro 订阅合理时使用。 FineReader 是一次性购买,不是订阅。

分步说明:用 Tesseract 使 PDF 可搜索

  1. 安装 Tesseract。 macOS 上 brew install tesseract。 Linux 上 apt install tesseract-ocr。Windows 上从 Tesseract GitHub 项目 下载安装程序。
  2. 安装语言数据。 英文默认包含。对其他语言,安装匹配的语言包 (例如 macOS 上 brew install tesseract-lang)。
  3. 打开终端。 导航到包含扫描 PDF 的文件夹。
  4. 运行 OCR。tesseract input.pdf output -l eng pdf
  5. 检查结果。 打开 output.pdf,搜索一个您在图像中能看到的 词,并尝试选择一段文字。如果搜索和选择都能工作,文本层已就位。
  6. 校对。 OCR 会误读。将一段文字复制到文本编辑器中并与图像对比。如果 您将依赖文本,在源文档中修正任何关键误识别。

OCR 准确度:预期

OCR 准确度几乎完全取决于源图像的质量。常见字体(Arial、Times New Roman)的印刷页面 干净 300 DPI 扫描可达到 98–99% 的字符准确度。装饰字体的影印页面 150 DPI 扫描可能 降至 90% 或更低 — 即 10 个字符中有 1 个错误,足以破坏搜索和复制粘贴。

损害准确度的因素:低分辨率(低于 200 DPI)、倾斜(以角度扫描的页面)、噪点 (脏扫描仪玻璃产生的斑点)、混合字体、手写、多栏布局、表格以及彩色背景上的文本。 如果您的扫描有以上任何一项,请预期需要仔细校对。

常见错误

  • 对敏感文档使用免费在线 OCR 服务。文件被上传到服务器。使用本地工具 — Tesseract、Acrobat 或 macOS Live Text。
  • 不校对就信任 OCR 输出。OCR 会误读。如果您将文本复制到合同、引用或数据库中,请对照图像验证每个词。
  • 需要原始外观时选择纯文本输出。纯文本 OCR 丢弃图像。如果签名、印章或布局重要,请改用可搜索 PDF 输出。
  • 对已有文本的 PDF 做 OCR。如果文件已有文本层(用 Ctrl+F 测试),OCR 是不必要的且可能劣化现有文本。参见为什么我无法在 PDF 中选择文本?确认文件确实需要 OCR。
  • 跳过语言包。Tesseract 默认英文。用英文语言模型对法语文档做 OCR 会产生垃圾。始终用正确语言 传入 -l。

编辑可搜索 PDF 的元数据

一旦 OCR 添加了文本层,使用 IXPDF 的编辑元数据工具设置标题、作者、主题和关键词 — 在浏览器中本地完成,无需上传。

打开编辑元数据