跳至内容
100% 本地 · 上传 0 KB压缩 PDF

PDF 提取文本

从 PDF 中提取文本。文件永不离开您的设备 —— 所有处理都在浏览器内本地完成。

设计即私密
您的文件永不离开您的设备。所有处理均在浏览器本地完成 —— 无上传、无服务器。

将 PDF 拖放到此处

或点击选择文件

您的文件永不离开您的设备。

Extracts the text content stream of each page. Scanned (image-only) PDFs have no text layer — the result will be empty for those files.

PDF 提取文本使用 PDF.js 在 Web Worker 中读取每页的文本内容流。结果在页面内预览中显示,并可下载为 .txt 文件,还提供复制到剪贴板按钮以便粘贴到其他应用。提取完全在浏览器内完成,文件不会被上传。仅扫描(纯图像)的 PDF 没有文本层,结果将为空;本工具如实反映这一情况,而非伪造 OCR。

工作原理

如何使用 PDF 提取文本

  1. 1
    拖入 PDF. 将 PDF 文件拖放到拖放区,或点击从设备选择文件。
  2. 2
    可选:设置页面范围. 输入如 1,3,5-7 仅从这些页面提取文本。留空则提取所有页面。
  3. 3
    执行「PDF 提取文本」. PDF.js 在 Web Worker 中于您的设备内读取每页的文本内容流。
  4. 4
    预览、复制或下载. 提取的文本显示在预览区。可复制到剪贴板或下载为 .txt 文件。

功能

此工具的功能

  • 从所有或选定页面提取文本
  • 可选保留布局(根据页面布局插入换行)
  • 页面内预览,含每页明细
  • 复制到剪贴板或下载为 .txt
  • 无需上传 —— 在浏览器内完全运行

限制

须知事项

  • 仅扫描(纯图像)的 PDF 没有文本层 —— 结果将为空(不执行 OCR;参见 OCR 指南)
  • 布局重建为尽力而为;复杂多栏布局可能与视觉阅读顺序不一致
  • ToUnicode 映射损坏的嵌入字体可能产生乱码
  • 图像内的文本不会被提取(仅读取真正的文本内容流)

常见问题

常见问题解答

为什么结果为空?

PDF 很可能是仅扫描(纯图像)的,或文本被烘焙到图像中。内容流中没有可提取的文本。解决办法是 OCR —— 关于可信的本地 OCR 工具,请参阅"如何让 PDF 可搜索"。IXPDF 不会在浏览器中伪造 OCR(精度不够可靠,无法发布)。

能处理加密 PDF 吗?

不能。如果 PDF 有密码保护,工具会显示"已加密"错误。请先解密再提取文本。

"保留布局"做什么?

勾选时,工具根据页面上文本项的 y 坐标插入换行,生成更接近视觉布局的文本。不勾选时,文本项以空格连接,更适合全文搜索和复制粘贴。

提取的文本准确吗?

对于有真正文本层(非扫描)的 PDF,提取的文本与所见一致。字体编码损坏(缺少 ToUnicode 映射)的 PDF 可能产生乱码 —— 这是文件属性,非工具 bug。

可以只从特定页面提取文本吗?

可以。在页面范围字段输入如 1,3,5-7。仅这些页面会按所列顺序提取。