Text aus einer PDF extrahieren
Text aus einer PDF zu extrahieren ist eine der häufigsten PDF-Aufgaben — Sie haben einen Bericht, einen Vertrag oder ein Forschungspapier als PDF und brauchen den Text in einem Textverarbeitungsprogramm, einer Tabelle, einem Suchindex oder einfach an einer Stelle, wo Sie ihn kopieren und einfügen können. Dieser Leitfaden behandelt drei kostenlose Methoden mit ehrlichen Datenschutz-Kompromissen für jede. Die erste Methode — IXPDFs PDF-to-Text-Werkzeug — läuft vollständig in Ihrem Browser und lädt Ihre Datei niemals hoch. Die zweite nutzt den integrierten PDF-Viewer Ihres Browsers für schnelles Kopieren/Einfügen. Die dritte verwendet Google Docs, was funktioniert, aber Ihre Datei auf Googles Server hochlädt. Für jede Methode erklären wir, wann Sie sie verwenden sollten und wann Sie nach etwas anderem greifen sollten.
Warum Text aus einer PDF extrahieren?
PDFs sind für die Anzeige und den Druck konzipiert, nicht für die Bearbeitung. Der Text in einer PDF ist in einem Inhaltsstrom gespeichert, der auf Layout, nicht auf Wiederverwendung optimiert ist. Aber es gibt viele Gründe, den Text herauszuholen:
- Kopieren/Einfügen in ein anderes Dokument. Sie müssen eine Passage in einer E-Mail, einem Bericht oder einem Zitat verwenden, und die Quelle ist eine PDF.
- Suchindex. Sie möchten einen lokalen Suchindex über einer Bibliothek von PDFs aufbauen und benötigen den Textinhalt.
- Barrierefreiheit. Bildschirmleser und andere Hilfsmittel arbeiten mit Klartext besser als mit manchen PDFs.
- Datenanalyse. Sie müssen Tabellen, Zahlen oder Schlüsselbegriffe für die Analyse in einer Tabelle oder einem Skript extrahieren.
- Übersetzung. Sie möchten ein Übersetzungswerkzeug auf den Text eines PDF-Dokuments anwenden.
Welcher Grund auch immer — das Ziel ist dasselbe: den Text aus der PDF in ein Format bringen, mit dem Sie arbeiten können. Die folgenden Methoden tun das alles — der Unterschied liegt darin, wie sie Ihre Datei behandeln und wie genau das Ergebnis ist.
Methode 1: IXPDF PDF-to-Text-Werkzeug (empfohlen, lokal)
IXPDFs PDF-to-Text-Werkzeug liest den Text-Inhaltsstrom jeder Seite mit PDF.js in einem Web Worker. Die Datei bleibt in Ihrem Browser — sie wird nie auf einen Server hochgeladen. Der extrahierte Text wird in einer Seitenvorschau angezeigt und als .txt-Download angeboten, mit einer Kopieren-in-Zwischenablage-Schaltfläche zum Einfügen in andere Apps.
- PDF-to-Text-Werkzeug öffnen unter/tools/pdf-to-text/.
- PDF auswählen.Datei in die Ablagezone ziehen oder per Klick wählen. Dateiname und Größe erscheinen darunter.
- Optional Seiten einschränken. Das Feld Seitenbereichakzeptiert Werte wie
1,3,5-7. Leer lassen, um Text von jeder Seite zu extrahieren. - Optional Layout erhalten. Layout erhalten ankreuzen, um Zeilenumbrüche basierend auf dem Seitenlayout einzufügen. Das erzeugt Text, der näher an der visuellen Leserichtung liegt. Für Volltextsuche und Kopieren/Einfügen, bei denen das Layout keine Rolle spielt, abwählen.
- Extraktion ausführen. Auf PDF to Text ausführen klicken. Das Werkzeug liest den Text-Inhaltsstrom jeder Seite in einem Web Worker auf Ihrem Gerät.
- Vorschau, kopieren oder herunterladen. Der extrahierte Text wird in einem Vorschaubereich mit seitenweiser Aufschlüsselung angezeigt. In die Zwischenablage kopieren oder als .txt-Datei herunterladen.
Methode 2: Kopieren/Einfügen im Browser-PDF-Viewer
Moderne Browser (Chrome, Edge, Firefox, Safari) haben einen integrierten PDF-Viewer, der PDFs direkt öffnen kann. Wenn die PDF eine echte Textebene hat (nicht gescannt), können Sie Text mit der Maus auswählen und mit Ctrl+C / Cmd+C kopieren. Dies ist die schnellste Methode für kleine Auszüge — kein Werkzeug, kein Upload, keine Installation.
- PDF im Browser öffnen. Datei doppelklicken oder auf einen Browser-Tab ziehen. Der integrierte PDF-Viewer öffnet sie.
- Text auswählen. Klicken und über den gewünschten Text ziehen. Wenn nichts markiert wird, ist die PDF wahrscheinlich gescannt — siehe Fehlerbehebung unten.
- Kopieren.
Ctrl+C/Cmd+Cdrücken oder rechtsklicken und Kopieren wählen. - Einfügen. Zum Zieldokument wechseln und
Ctrl+V/Cmd+Vdrücken.
Diese Methode eignet sich für einige Sätze oder einen Absatz. Für ganze Dokumente wird sie mühsam — Sie müssen jede Seite einzeln auswählen, und die Auswahl wird über Seitenumbrüche möglicherweise nicht sauber übernommen. Für die Extraktion ganzer Dokumente Methode 1 verwenden.
Methode 3: Google Docs Import (funktioniert, lädt aber zu Google hoch)
Google Docs kann eine PDF öffnen und in ein bearbeitbares Dokument umwandeln. Dies funktioniert gut bei PDFs mit komplexen Layouts, und das Ergebnis ist ein Google Doc, das Sie bearbeiten, teilen oder als .docx exportieren können. Der Kompromiss ist der Datenschutz: Das Hochladen der PDF zu Google bedeutet, dass Google eine Kopie hat. Wenn das Dokument sensibel ist, verwenden Sie stattdessen Methode 1.
- Zu Google Drive gehen. Anmelden beidrive.google.com.
- PDF hochladen. Datei in Drive ziehen oder auf Neu → Datei-Upload klicken. Die Datei liegt nun auf Googles Servern.
- Mit Google Docs öffnen. PDF rechtsklicken und Öffnen mit → Google Docs wählen. Google wandelt die PDF in ein bearbeitbares Dokument um.
- Text kopieren oder exportieren. Alles mit
Ctrl+Aauswählen, mitCtrl+Ckopieren und einfügen, wohin Sie es brauchen. Oder Datei → Herunterladen → Klartext (.txt) verwenden, um das ganze Dokument zu exportieren.
Fehlerbehebung: gescannte PDFs und OCR
Wenn keine der obigen Methoden Text erzeugt — das IXPDF-Werkzeug ein leeres Ergebnis zurückgibt, der Browser-Viewer nichts auswählen lässt und Google Docs ein Bild ohne Text importiert — ist die PDF höchstwahrscheinlich gescannt. Eine gescannte PDF ist ein Foto von Papier: jede Seite ist ein großes Bild, und es gibt keinen Text im Inhaltsstrom. Keine Menge Kopieren/Einfügen oder Textextraktion bekommt Text aus einem Bild. Die Lösung ist OCR (optische Zeichenerkennung), die das Bild analysiert und eine neue Textebene in die PDF schreibt.
IXPDF kann heute im Browser keine OCR durchführen. Browser-basierte OCR-Engines (Tesseract.js, OCRad.js) existieren, aber ihre Genauigkeit bei realen Scans reicht nicht zum Ausliefern — sie lesen gängige Schriften falsch, scheitern an mehrspaltigen Layouts und erzeugen Text, der für Suche und Barrierefreiheit schlimmer ist als gar kein Text. Wir werden kein Werkzeug ausliefern, das stillschweigend falschen Text zurückgibt. Für vertrauenswürdige lokale OCR-Werkzeuge (Adobe Acrobat, Tesseract, macOS Preview Live Text, ABBYY FineReader), die auf Ihrem Rechner ohne Upload laufen, siehe So machen Sie eine PDF durchsuchbar.
Eine tiefere Erläuterung, warum die Textauswahl scheitert und wie Sie die Ursache diagnostizieren (gescannt, nur Bild, abgeflacht oder kaputte Schrift-Codierung), finden Sie unter Warum kann ich keinen Text in einer PDF auswählen?.
Welche Methode soll ich verwenden?
- Ganzes Dokument, Datenschutz zählt:IXPDF PDF to Text verwenden. Lokal, kostenlos, kein Upload.
- Einige Sätze, schnell: den Browser-PDF-Viewer und Kopieren/Einfügen verwenden. Kein Werkzeug nötig.
- Komplexes Layout, Upload in Ordnung: Google Docs Import. Beste Umwandlungsqualität für trickreiche Layouts, aber die Datei geht zu Google.
- Gescannte PDF: keine der obigen wird funktionieren. Sie benötigen OCR — siehe So machen Sie eine PDF durchsuchbar.
FAQ
Ist das IXPDF PDF-to-Text-Werkzeug wirklich kostenlos?
Ja. Es ist kostenlos, ohne Konto, ohne Anmeldung, ohne Wasserzeichen, ohne Nutzungslimit. Es läuft vollständig in Ihrem Browser — es gibt keinen Server, der Sie berechnen könnte.
Funktioniert es bei einer verschlüsselten PDF?
Nein. Wenn die PDF passwortgeschützt ist, zeigt das Werkzeug einen „verschlüsselt"-Fehler. Entschlüsseln Sie die Datei zuerst (siehe So entsperren Sie eine PDF), und extrahieren Sie dann den Text.
Warum ist der extrahierte Text verstümmelt?
Einige PDFs haben eine kaputte Schrift-Codierung (fehlende oder falsche ToUnicode-Abbildung). Der Text wird auf dem Bildschirm korrekt gerendert (der Viewer hat die Schriftkonturen), kann aber für die Extraktion nicht auf Unicode-Zeichen zurückabgebildet werden. Dies ist eine Eigenschaft der Datei, kein Fehler im Werkzeug. Die Lösung ist, aus der Quellanwendung mit korrekter Unicode-Abbildung neu zu exportieren oder OCR auf die Datei anzuwenden, um eine frische Textebene hinzuzufügen.
Bewahrt das Werkzeug das Layout der ursprünglichen PDF?
Wenn Sie Layout erhalten ankreuzen, fügt das Werkzeug Zeilenumbrüche basierend auf der y-Position der Textelemente auf der Seite ein und erzeugt Text, der näher am visuellen Layout liegt. Dies ist nach bestem Bemühen — komplexe mehrspaltige Layouts, Tabellen und Seitenleisten entsprechen möglicherweise nicht der visuellen Leserichtung. Für Volltextsuche und Kopieren/Einfügen die Option abwählen; das Werkzeug verbindet dann Textelemente mit Leerzeichen, was für die Suche zuverlässiger ist.
Kann ich Text nur aus bestimmten Seiten extrahieren?
Ja. Einen Seitenbereich wie 1,3,5-7 ins Feld Seitenbereich eingeben. Nur diese Seiten werden in der angegebenen Reihenfolge extrahiert. Feld leer lassen, um Text von jeder Seite zu extrahieren.
Was ist der Unterschied zwischen PDF to Text und OCR?
PDF to Text liest den Text, der bereits im Inhaltsstrom der PDF vorhanden ist. Es funktioniert nur bei PDFs mit einer echten Textebene (von einem Textverarbeitungsprogramm erstellt, aus einer App exportiert usw.). OCR (optische Zeichenerkennung) analysiert die Pixel eines Bildes und erkennt Buchstabenformen, um eine neue Textebene zu erstellen. OCR wird für gescannte PDFs, Fotos und jede PDF benötigt, bei der der Text in ein Bild gebacken wurde. IXPDF macht Ersteres; für Letzteres siehe So machen Sie eine PDF durchsuchbar.
Text jetzt aus Ihrer PDF extrahieren
Kostenlos, lokal, kein Upload. PDF ablegen, Ausführen klicken und Text in Sekunden erhalten.
PDF to Text öffnen