如何从 PDF 提取文本
从 PDF 提取文本是最常见的 PDF 任务之一 — 您有一份报告、合同或研究论文是 PDF 格式,需要将其中的文本取到文字处理软件、电子表格、搜索索引,或仅仅是一个可以复制粘贴的地方。本指南介绍三种免费方法,并如实说明各自的隐私权衡。第一种方法 — IXPDF 的 PDF to Text 工具 — 完全在浏览器中运行,从不上传您的文件。第二种使用浏览器内置的 PDF 查看器快速复制粘贴。第三种使用 Google Docs,可行但会将文件上传到 Google 的服务器。对每种方法,我们说明何时使用以及何时该另寻他法。
为什么要从 PDF 提取文本
PDF 为查看和打印而设计,并非为编辑而设计。PDF 内的文本存储在为布局优化而非复用优化的内容流中。但您可能想取出文本的理由很多:
- 复制粘贴到另一文档。 您需要在邮件、报告或引用中引用一段文字,而源是 PDF。
- 搜索索引。 您想为 PDF 库构建本地搜索索引,需要文本内容。
- 无障碍访问。 屏幕阅读器等辅助技术处理纯文本比处理某些 PDF 更好。
- 数据分析。 您需要提取表格、数字或关键短语,在电子表格或脚本中分析。
- 翻译。 您想对 PDF 文档的文本运行翻译工具。
无论原因如何,目标相同:将文本从 PDF 取出,放入可处理的格式。以下方法都能做到 — 区别在于它们如何处理您的文件以及结果的准确性。
方法 1:IXPDF PDF to Text 工具(推荐,本地)
IXPDF 的 PDF to Text 工具使用 PDF.js 在 Web Worker 中读取每页的文本内容流。文件留在浏览器中 — 永不上传到任何服务器。提取的文本显示在页面内预览中,并提供 .txt 下载,还有用于粘贴到其他应用的复制到剪贴板按钮。
- 打开 PDF to Text 工具/tools/pdf-to-text/。
- 选择 PDF。将文件拖到拖放区或点击浏览。文件名和大小显示在下方。
- 可选:限制页面。 页面范围 字段接受如
1,3,5-7的值。留空则从每页提取文本。 - 可选:保留布局。 勾选 保留布局 根据页面布局插入换行。这会生成更接近视觉阅读顺序的文本。用于不在乎布局的全文搜索和复制粘贴时取消勾选。
- 运行提取。 点击 运行 PDF to Text。工具在您设备的 Web Worker 中读取每页的文本内容流。
- 预览、复制或下载。 提取的文本显示在预览区,带每页明细。复制到剪贴板或下载为 .txt 文件。
方法 2:在浏览器 PDF 查看器中复制粘贴
现代浏览器(Chrome、Edge、Firefox、Safari)有内置 PDF 查看器可直接打开 PDF。如果 PDF 有真实文本层(非扫描),可用鼠标选择文本并用 Ctrl+C / Cmd+C 复制。这是小段摘录最快的方法 — 无需工具、无需上传、无需安装。
- 在浏览器中打开 PDF。 双击文件或拖到浏览器标签。浏览器内置 PDF 查看器打开它。
- 选择文本。 点击并拖过想要的文本。如果无任何高亮,PDF 很可能是扫描的 — 见下方故障排除。
- 复制。 按
Ctrl+C/Cmd+C或右键选择 复制。 - 粘贴。 切换到目标文档按
Ctrl+V/Cmd+V。
此方法适合几句话或一段文字。对整篇文档就繁琐了 — 必须逐页选择,且选择可能无法干净地跨页延续。整篇文档提取请用方法 1。
方法 3:Google Docs 导入(可行,但上传到 Google)
Google Docs 可打开 PDF 并转为可编辑文档。对复杂布局的 PDF 效果很好,结果是可编辑、共享或导出为 .docx 的 Google Doc。权衡是隐私:将 PDF 上传到 Google 意味着 Google 持有副本。如果文档敏感,请改用方法 1。
- 前往 Google Drive。 在drive.google.com 登录。
- 上传 PDF。 将文件拖入 Drive 或点击 新建 → 文件上传。文件现在在 Google 的服务器上。
- 用 Google Docs 打开。 右键 PDF 选择 打开方式 → Google Docs。Google 将 PDF 转为可编辑文档。
- 复制或导出文本。 用
Ctrl+A全选,Ctrl+C复制,粘贴到任何需要的地方。或用 文件 → 下载 → 纯文本 (.txt) 导出整篇文档。
故障排除:扫描 PDF 与 OCR
如果以上方法都不产生文本 — IXPDF 工具返回空结果,浏览器查看器不让您选择任何内容,Google Docs 导入无文本的图像 — PDF 很可能是扫描的。扫描 PDF 是纸的照片:每页是一张大图,内容流中没有文本。任何复制粘贴或文本提取都无法从图像中取出文本。解决办法是 OCR(光学字符识别),它分析图像并向 PDF 写入新的文本层。
IXPDF 目前无法在浏览器中执行 OCR。存在基于浏览器的 OCR 引擎(Tesseract.js、OCRad.js),但它们对真实扫描的准确度不足以交付 — 它们误读常见字体,在多栏布局上挣扎,产生的文本对搜索和无障碍而言比没有文本更糟。我们不会交付一个悄悄返回错误文本的工具。关于在您机器上运行、不上传文件的可靠本地 OCR 工具(Adobe Acrobat、Tesseract、macOS Preview 实况文本、ABBYY FineReader),请见 如何使 PDF 可搜索。
关于文本选择失败的原因及如何诊断(扫描、仅图像、扁平化或字体编码损坏)的深入探讨,请见 为什么无法在 PDF 中选择文本?。
该用哪种方法?
- 整篇文档,隐私重要: 使用IXPDF PDF to Text。本地、免费、无上传。
- 几句话,快速: 用浏览器 PDF 查看器复制粘贴。无需工具。
- 复杂布局,可上传: 用 Google Docs 导入。对棘手布局转换质量最佳,但文件会到 Google。
- 扫描 PDF: 以上都不行。需要 OCR — 见 如何使 PDF 可搜索。
FAQ
IXPDF PDF to Text 工具真的免费吗?
是的。免费、无账号、无注册、无水印、无使用限制。完全在浏览器中运行 — 没有服务器向您收费。
能在加密 PDF 上工作吗?
不能。如果 PDF 受密码保护,工具显示"已加密"错误。请先解密文件(见 如何解锁 PDF),然后提取文本。
为什么提取的文本是乱码?
某些 PDF 的字体编码损坏(ToUnicode 映射缺失或错误)。文本在屏幕上正确渲染(查看器有字体轮廓)但无法映射回 Unicode 字符以供提取。这是文件属性,不是工具的 bug。修复方法是从源应用以正确的 Unicode 映射重新导出,或对文件运行 OCR 添加新的文本层。
工具会保留原 PDF 的布局吗?
勾选 保留布局 时,工具根据页面上文本项的 y 位置插入换行,生成更接近视觉布局的文本。这是尽力而为 — 复杂的多栏布局、表格和侧边栏可能不匹配视觉阅读顺序。用于全文搜索和复制粘贴时取消勾选,工具会用空格连接文本项,对搜索更可靠。
能只从特定页面提取文本吗?
可以。在 页面范围 字段输入如 1,3,5-7。仅按列出顺序提取这些页面。留空则从每页提取。
PDF to Text 和 OCR 的区别是什么?
PDF to Text 读取 PDF 内容流中已有的文本。它只对有真实文本层的 PDF(由文字处理软件创建、从应用导出等)有效。OCR(光学字符识别)分析图像的像素并识别字形以创建新的文本层。OCR 用于扫描 PDF、照片以及文本被烧入图像的任何 PDF。IXPDF 做前者;对于后者,见 如何使 PDF 可搜索。