跳至内容
100% 本地 · 上传 0 KB压缩 PDF

为什么无法在 PDF 中选择文本?

🔒 您的文件永不离开您的设备。所有处理均在浏览器本地完成。

如果无法在 PDF 中选择文本 — 点击并拖拽覆盖一个词没有高亮 — 文本不在文件的内容流中。这通常意味着四种情况之一:PDF 是扫描图像、文本在导出时被烤入图像、文件以丢失文本层的方式被扁平化、或字体编码损坏。前三种的修复是 OCR。本指南说明如何判断哪种原因及如何处理。

4 种常见原因

1. PDF 是扫描的(仅图像)

最常见的原因。扫描文档是纸张的照片 — 每页是一个大图像。内容流中没有文本,所以没有可选择的。扫描仪默认生成仅图像 PDF;扫描仪软件中的"可搜索 PDF"选项是在扫描时通过 OCR 添加文本层的那个。

如何检查:放大到 400%。如果文本像素化(字母形状边缘有锯齿),它是图像。真实文本在任何缩放都保持清晰,因为它从字体轮廓渲染。也试试 Ctrl+F / Cmd+F — 如果查找无法定位您能清楚看到的词,文件没有文本层。

修复:运行 OCR 添加可搜索文本层。参阅如何使 PDF 可搜索了解本地工具。

2. 文本被烤入图像

某些应用程序导出的 PDF 中文本被光栅化 — 转换为像素并作为图像嵌入,即使源是真实文本。这发生在光栅化一切的"打印到 PDF"驱动程序、将文本扁平到背景图像上的演示导出器、以及经过将所有内容转为图像的"扁平化"步骤的 PDF。

如何检查:与扫描相同 — 放大到 400% 查找像素化。文件可能原本是真实文本 PDF;光栅化发生在导出时。

修复:从源应用程序重新导出,保留文本为文本(不光栅化)。如果没有源,对现有文件运行 OCR。

3. PDF 被扁平化

扁平化将表单字段、注释、有时将文本转为静态内容。某些扁平操作保留文本层;其他光栅化一切。如果扁平步骤光栅化了,结果是仅图像且不可选择。

如何检查:再次缩放测试。如果 400% 下文本仍清晰但无法选择,扁平将文本保留为轮廓(矢量形状)而非字符 — 罕见但可能。如果像素化,扁平光栅化了。

修复:用保留文本层的工具重新扁平化,或从源重新导出。参阅如何扁平化 PDF了解保留文本与光栅化扁平的区别。

4. 字体编码损坏(ToUnicode 缺失)

最罕见的原因。文本存在于内容流中且正确渲染,但字体的 ToUnicode 映射缺失或错误。查看器可以显示字形(它们有字体轮廓)但无法将它们映射回 Unicode 字符以供选择、复制或搜索。您能看到文本但无法选择。

如何检查:文本在任何缩放都清晰(是真实文本而非图像)但无法选择或复制。查找也失败。这在旧 CAD 工具或小众导出器生成的 PDF 中常见。

修复:从源以正确的 Unicode 映射重新导出。如果没有源,运行 OCR — 它将添加带有正确 Unicode 的新文本层,替换损坏的。

IXPDF 无法在浏览器中执行 OCR
OCR(光学字符识别)根据 AGENTS.md §16 标记为需要研究。浏览器端 OCR 引擎存在(Tesseract.js、OCRad.js),但它们对真实世界扫描的准确性不足以发布 — 它们误读常见字体、难以处理多栏布局,产生的文本对于搜索和无障碍来说比没有文本更差。我们不会发布一个默默返回错误文本的工具。参阅如何使 PDF 可搜索了解可信的本地 OCR 工具。

快速诊断清单

  1. 尝试选择一个词。 点击并拖拽覆盖一个词。如果没有高亮,文本不在内容流中。
  2. 放大到 400%。 如果文本像素化,是图像(扫描、光栅化或扁平为图像)。如果保持清晰,是真实文本但编码损坏。
  3. 尝试查找(Ctrl+F / Cmd+F)。 如果查找无法定位您能看到的词,文件没有可搜索文本层。
  4. 检查文件大小。 扫描 PDF 通常很大(每页一个全页图像)。不可选择文本的小文件更可能是编码损坏。
  5. 如需要则应用 OCR。 使用本地 OCR 工具添加可搜索文本层。

现在就能运行的快速测试

如果您的 PDF 由扫描文档创建,文本提取将返回空。试试 IXPDF 的PDF 转文本工具 — 拖入文件,运行,检查结果。如果提取的文本为空,您的 PDF 是扫描(或光栅化)的,需要 OCR 使文本可选择;参阅如何使 PDF 可搜索了解可信的本地 OCR 选项。如果工具确实返回文本但您仍无法在原 PDF 中选择,原因可能是字体编码损坏(上面原因 4)— 文本层存在,但查看器无法将字形映射回 Unicode。

为什么 OCR 是修复(而非仅权宜之计)

对于扫描、光栅化和编码损坏的 PDF,OCR 是唯一的修复 — 没有原始文本可恢复。OCR 分析图像、识别字母形状、将新文本层写入 PDF。结果是"可搜索 PDF":原始图像保持可见(布局和签名保留),识别的文本作为不可见层放在后面供选择、复制和搜索。

OCR 的质量决定结果的质量。现代 OCR 引擎(Tesseract 5、ABBYY FineReader、Adobe Acrobat 的 OCR)在干净的 300 DPI 常见字体扫描上表现良好。它们在手写、低分辨率扫描、装饰性字体和文本与图像混合的多栏布局上困难。依赖前始终校对识别的文本。

常见误区

  • 以为 PDF 是"加密"或"受保护"的。 不可选择文本几乎从不是安全功能。通常是扫描文件。在 Acrobat Reader 中打开检查 — 文件 > 属性 > 安全 中没有限制就不是受保护的。
  • 对敏感文档使用免费在线 OCR 服务。 文件上传到服务器。使用本地工具 — Tesseract、Acrobat 或 macOS 实时文本。
  • 不校对就信任 OCR 输出。 OCR 会误读。如果将文本复制到合同或引用中,逐词与图像核对。
  • 重新扫描而非重新导出。 如果有源文档(Word、PowerPoint、InDesign),重新导出为 PDF — 文本将是真实的且可选择。重新扫描是最后手段。

使您的 PDF 可搜索

IXPDF 今天无法在浏览器中做 OCR — 准确性不足以发布。参阅我们的指南了解在您的机器上运行不上传文件的可信本地 OCR 工具。

了解 OCR 选项