為什麼我無法在 PDF 中選取文字?
如果您無法在 PDF 中選取文字——點擊並拖曳過一個字沒有反白任何內容——文字不在檔案的內容串流中。這通常意味著以下四種情況之一:PDF 是掃描影像、文字在匯出時被燒入影像、檔案以失去文字層的方式扁平化,或字型編碼損壞。前三種的修正方法是 OCR。本指南說明如何區分適用的原因及處理方法。
4 個常見原因
1. PDF 已掃描(純影像)
最常見的原因。掃描的文件是紙張的照片——每一頁是一張大影像。內容串流中沒有文字,因此沒有可選取的內容。掃描器預設產生純影像 PDF;掃描器軟體中的「可搜尋 PDF」選項是透過 OCR 在掃描影像上添加文字層的選項。
如何檢查:放大至 400%。如果文字像素化(您看到字母形狀周圍有鋸齒狀邊緣),那是影像。真正的文字在任何縮放下都保持清晰,因為它是從字型輪廓顯示的。也試試 Ctrl+F / Cmd+F——如果搜尋找不到您清楚看到的字,檔案沒有文字層。
修正方法:執行 OCR 以添加可搜尋的文字層。請參考 如何讓 PDF 可搜尋 了解可在本機執行的工具。
2. 文字被燒入影像
某些應用程式匯出的 PDF 中文字被點陣化——轉換為像素並嵌入為影像,即使來源是真正的文字。這發生在將所有內容點陣化的「列印至 PDF」驅動程式、將文字扁平到背景影像上的簡報匯出器,以及經過將所有內容轉換為影像的「扁平化」步驟的 PDF。
如何檢查:與掃描相同——放大至 400% 並尋找像素化。檔案可能原本是真正文字的 PDF;點陣化發生在匯出時。
修正方法:從來源應用程式重新匯出,將文字保留為文字(非點陣化)。如果沒有來源,對現有檔案執行 OCR。
3. PDF 已扁平化
扁平化將表單欄位、註解和有時將文字轉換為靜態內容。某些扁平化操作保留文字層;其他則將所有內容點陣化。如果扁平化步驟已點陣化,結果是純影像且無法選取。
如何檢查:再次進行縮放測試。如果文字在 400% 時仍然清晰但您無法選取,扁平化將文字保留為輪廓(向量形狀)而非字元——罕見但可能。如果像素化,扁平化已點陣化。
修正方法:用保留文字層的工具重新扁平化,或從來源重新匯出。請參考如何扁平化 PDF了解保留文字與點陣化扁平化之間的差異。
4. 字型編碼損壞(ToUnicode 缺失)
最罕見的原因。文字存在於內容串流中且正確顯示,但字型的 ToUnicode 映射缺失或錯誤。檢視器可以顯示字元(它們有字型輪廓)但無法將它們重新映射為 Unicode 字元以供選取、複製或搜尋。您看得到文字但無法選取。
如何檢查:文字在任何縮放下都清晰(是真正的文字,不是影像)但您無法選取或複製。搜尋也失敗。這常見於由舊版 CAD 工具或小眾匯出器產生的 PDF。
修正方法:從來源以正確的 Unicode 映射重新匯出。如果沒有來源,執行 OCR——它會添加具有正確 Unicode 的新文字層,替換損壞的層。
快速診斷清單
- 嘗試選取一個字。點擊並拖曳過一個字。如果沒有反白,文字不在內容串流中。
- 放大至 400%。如果文字像素化,那是影像(掃描、點陣化或扁平化為影像)。如果保持清晰,是真正的文字但編碼損壞。
- 嘗試搜尋(Ctrl+F / Cmd+F)。如果搜尋找不到您看到的字,檔案沒有可搜尋的文字層。
- 檢查檔案大小。掃描的 PDF 通常很大(每頁一張全頁影像)。具有不可選取文字的小檔案更可能是編碼損壞的情況。
- 必要時套用 OCR。使用本機 OCR 工具添加可搜尋的文字層。
您現在可以執行的快速測試
如果您的 PDF 是從掃描文件建立的,文字擷取將回傳空結果。試試 IXPDF 的 PDF 轉文字 工具——拖放您的檔案,執行它,並檢查結果。如果擷取的文字為空,您的 PDF 已掃描(或已點陣化),需要 OCR(光學字元辨識)才能讓文字可選取;請參考如何讓 PDF 可搜尋 了解可信賴的本機 OCR 選項。如果工具回傳了文字但您仍然無法在原始 PDF 中選取,原因可能是字型編碼損壞(上述原因 4)——文字層存在,但檢視器無法將字元重新映射為 Unicode。
為什麼 OCR 是修正方法(而不只是權宜之計)
對於掃描、點陣化和編碼損壞的 PDF,OCR 是唯一的修正方法——沒有原始文字可復原。OCR 分析影像、辨識字母形狀,並在 PDF 中寫入新的文字層。結果是「可搜尋 PDF」:原始影像保持可見(因此版面和簽名得以保留),而辨識的文字作為隱形層放在後面,供選取、複製和搜尋使用。
OCR 的品質決定結果的品質。現代 OCR 引擎(Tesseract 5、ABBYY FineReader、Adobe Acrobat 的 OCR)對 300 DPI 清晰掃描的常見字型表現良好。它們在手寫、低解析度掃描、裝飾性字型以及文字和影像混合的多欄版面上表現不佳。在使用前務必校對辨識的文字。
常見錯誤
- 假設 PDF「已加密」或「受保護」。無法選取的文字鮮少是安全功能。通常是掃描的檔案。在 Acrobat Reader 中開啟檢查——如果 File > Properties > Security 中未列出限制,檔案未受保護。
- 對敏感文件使用免費的線上 OCR 服務。檔案會被上傳到伺服器。請使用本機工具——Tesseract、Acrobat 或 macOS 即時文字。
- 未經校對就信任 OCR 輸出。OCR 會誤判。如果您將文字複製到合約或引用中,請對照影像檢查每個字。
- 重新掃描而非重新匯出。如果您有來源文件(Word、PowerPoint、InDesign),重新匯出為 PDF——文字會是真正的且可選取。重新掃描是最後手段。