コンテンツへスキップ
100% ローカル · アップロード 0 KBPDF を圧縮

PDFを検索可能にする方法

🔒 ファイルは端末から送信されません。すべての処理はブラウザ内でローカルに行われます。

スキャンPDFは紙の写真 — ファイル内にテキストはなく、ピクセルだけ。検索・選択・コピー・ スクリーンリーダーの使用ができません。検索可能にするとはOCR(光学式文字認識)を 実行して画像の背後にテキストレイヤーを追加することです。このガイドは3種類のOCR出力、 これをうまく行うローカルツール、そしてIXPDFが今日ブラウザでOCRを行わない理由を解説します。

IXPDFは今日ブラウザでOCRを行えません
ブラウザOCRエンジン(Tesseract.js、OCRad.js)は存在しますが、実世界のスキャンに対する 精度が出荷レベルに達しません。よくあるフォントの誤読、段組みレイアウトでの苦戦、 検索やアクセシビリティにおいてテキストなしより悪いテキストの生成。誤ったテキストを 静かに返すツールは出荷しません(AGENTS.md §16)。これは要研究と マーク。以下のツールはマシン上でローカルに実行され、ファイルをアップロードしません。

3種類のOCR出力タイプ

OCRツールは3種類の異なる出力を生成できます。どれが欲しいかは結果で何をするかによります。

1. 検索可能PDF(画像 + 不可視テキスト)

最も一般的で通常は正しい選択。元のページ画像がそのまま表示 — レイアウト、署名、スタンプ、 手書きすべて元の通り。画像の背後にOCRが不可視テキストレイヤーを追加。検索・選択・コピー・ スクリーンリーダー使用が可能。画面に見えるのは元のスキャン。Adobe Acrobat、Tesseract、 ABBYYがデフォルトでこれを生成。

最適: 元の外観が重要なスキャン文書のアーカイブ(契約書、領収書、署名付き手紙)。

2. テキストのみPDF(認識テキスト、画像なし)

OCRが画像を認識テキストで完全に置換。結果は小さく、完全に選択可能で、通常のテキストPDF のように見えます — ただし元のレイアウトは近似で、OCRが認識できなかったコンテント (署名、スタンプ、手書き)は失われます。

最適: テキストだけが必要で元の外観が重要でない場合 (例:スキャン手紙の本文をナレッジベース用の検索可能ファイルに抽出)。

3. デュアルレイヤーPDF(画像 + テキスト、両方表示)

より一般的でない形式で、元の画像と認識テキストを並べて表示、または画像を薄くして テキストを上に重ねて表示。レビューアが誤読を捕捉するためOCR出力をオリジナルと比較 する必要がある法務・アーカイブワークフローで使用。ABBYY FineReaderとAdobe Acrobat Pro がこれをサポート。

最適: 法務レビュー、アーカイブ品質管理、OCR精度をソースに対して 検証する必要があるワークフロー。

ローカルOCRツール

以下のツールはすべてマシン上で実行されます。どれもドキュメントをアップロードしません。 これは重要です:スキャン契約書・診療記録・税務書類は「無料オンラインOCR」サービスに 送るべきではありません — その時点でコンテントが他人のサーバーにあります。

1. Adobe Acrobat Pro(有料、ゴールドスタンダード)

スキャンPDFを開き、ツール > スキャン & OCR > テキストを認識 > このファイル内。言語と出力タイプを選択(検索可能画像がデフォルトで通常は正しい)。 AcrobatのOCRは実世界スキャンで最も精度が高く、段組みレイアウトをうまく処理し、 誤認識単語をインラインで修正可能。欠点はコスト — Acrobat Proはサブスクリプション。

2. Tesseract(無料、オープンソース、コマンドライン)

最も精度の高い無料OCRエンジン。Tesseract GitHubプロジェクトまたはパッケージマネージャー (macOSはbrew install tesseract、Linuxはapt install tesseract-ocr) からインストール。次に:

tesseract input.pdf output -l eng pdf

これでoutput.pdfが元の画像と不可視の英語テキストレイヤーを持つ検索可能PDF として生成。Tesseractは複雑レイアウトではAcrobatほど正確ではありませんが、クリーンな 単一段組みスキャンでは優秀。100以上の言語をサポート — 英語/フランス語混在文書には-l eng+fraを指定。

3. macOS Preview Live Text(無料、macOS 12+)

macOS Monterey以降、PreviewはシステムのLive Text機能を使ってスキャンPDFや画像内の テキストを認識可能。PreviewでPDFを開くと、テキストを直接選択・コピー・検索できます — macOSがその場でテキストレイヤーを追加。検索可能版を保存するにはファイル > PDFとして書き出し。Live Textは英語文書で高速・高精度ですが、 Tesseractより言語サポートが限定的。

4. ABBYY FineReader(有料、高精度)

困難なスキャン — 手書き、低コントラスト、混在フォント、段組みレイアウト — で 高精度で知られる商用OCRツール。検証用のデュアルレイヤー出力をサポート。Tesseractが 精度不足でAcrobat Proのサブスクリプションを正当化できない場合に使用。 FineReaderは買い切りでサブスクリプションではありません。

ステップバイステップ:TesseractでPDFを検索可能に

  1. Tesseractをインストール。 macOSではbrew install tesseract。 Linuxではapt install tesseract-ocr。WindowsではTesseract GitHubプロジェクトから インストーラをダウンロード。
  2. 言語データをインストール。 英語はデフォルトで含まれます。他の言語は 一致する言語パックをインストール(例:macOSではbrew install tesseract-lang)。
  3. ターミナルを開く。 スキャンPDFを含むフォルダに移動。
  4. OCRを実行。tesseract input.pdf output -l eng pdf
  5. 結果を確認。 output.pdfを開き、画像に見える単語を検索し、 段落を選択してみる。検索と選択が機能すればテキストレイヤーが配置済み。
  6. 校正。 OCRは誤読します。段落をテキストエディタにコピーし画像と比較。 テキストに依存する場合は致命的な誤認識をソース文書で修正。

OCR精度:期待値

OCR精度はほぼ完全にソース画像の品質に依存。よくあるフォント(Arial、Times New Roman)で 印刷ページのクリーンな300 DPIスキャンは98〜99%の文字精度。装飾フォントでコピーした ページの150 DPIスキャンは90%以下に落ちる可能性 — 10文字に1文字の誤りで、検索や コピー・ペーストを壊すには十分。

精度を下げる要因:低解像度(200 DPI未満)、傾き(角度でスキャンされたページ)、 ノー(汚れたスキャナーガラスからの斑点)、混在フォント、手書き、段組みレイアウト、 表、色背景上のテキスト。スキャンにこれらがあれば、慎重な校正を期待してください。

よくある間違い

  • 機密文書に無料オンラインOCRサービスを使用。ファイルがサーバーにアップロードされます。ローカルツールを使用 — Tesseract、Acrobat、 またはmacOS Live Text。
  • 校正なしでOCR出力を信頼。OCRは誤読します。契約書・引用・データベースにテキストをコピーする場合は、 画像に対してすべての単語を検証。
  • 元の外観が必要なのにテキストのみ出力を選択。テキストのみOCRは画像を破棄。署名・スタンプ・レイアウトが重要なら検索可能PDF出力を 使用。
  • 既にテキストがあるPDFにOCRをかける。ファイルに既にテキストレイヤーがある場合(Ctrl+Fでテスト)、OCRは不要で既存テキストを 劣化する可能性。PDFでテキストを選択 できないのはなぜ?でファイルが実際にOCRを必要か確認。
  • 言語パックをスキップ。 Tesseractはデフォルトで英語。英語言語モデルで フランス語文書にOCRをかけるとゴミが出ます。常に正しい言語で-lを指定。

検索可能PDFのメタデータを編集

OCRがテキストレイヤーを追加したら、IXPDFのメタデータ編集ツールでタイトル・作成者・ 主題・キーワードを設定 — ブラウザ内でローカルに、アップロードなし。

メタデータ編集を開く