PDF zu Text extrahieren
Extrahiert Text aus einem PDF. Ihre Dateien verlassen Ihr Gerät nicht — die gesamte Verarbeitung erfolgt lokal in Ihrem Browser.
PDF hierher ziehen
oder klicken, um eine Datei zu wählen
Ihre Dateien verlassen nie Ihr Gerät.
Extracts the text content stream of each page. Scanned (image-only) PDFs have no text layer — the result will be empty for those files.
„PDF zu Text extrahieren“ liest den Text-Inhaltsstrom jeder Seite mit PDF.js in einem Web Worker. Das Ergebnis wird in einer Seitenvorschau angezeigt und als .txt-Download angeboten, mit einer Kopieren-in-Zwischenablage-Funktion für andere Apps. Die Extraktion erfolgt vollständig in Ihrem Browser — Ihre Datei wird nicht hochgeladen. Gescannte (nur-Bild-) PDFs haben keine Textschicht und ergeben ein leeres Ergebnis; das Werkzeug zeigt dies ehrlich an, statt OCR vorzutäuschen.
So funktioniert es
So verwenden Sie PDF zu Text extrahieren
- 1PDF ablegen. Ziehen Sie das PDF per Drag & Drop in die Ablagezone, oder klicken Sie, um die Datei von Ihrem Gerät auszuwählen.
- 2Optional Seitenbereich festlegen. Geben Sie Seiten wie 1,3,5-7 ein, um nur aus diesen Seiten zu extrahieren. Leer lassen für alle Seiten.
- 3„PDF zu Text extrahieren“ ausführen. PDF.js liest den Text-Inhaltsstrom jeder Seite in einem Web Worker auf Ihrem Gerät.
- 4Vorschau, kopieren oder herunterladen. Der extrahierte Text wird in einem Vorschau-Bereich angezeigt. Kopieren Sie ihn in die Zwischenablage oder laden Sie ihn als .txt-Datei herunter.
Funktionen
Was dieses Werkzeug tut
- Extrahiert Text aus allen oder ausgewählten Seiten
- Optionale Layout-Erhaltung (fügt Zeilenumbrüche nach Seitenlayout ein)
- Seitenvorschau mit Aufschlüsselung pro Seite
- In Zwischenablage kopieren oder als .txt herunterladen
- Kein Upload — läuft vollständig in Ihrem Browser
Einschränkungen
Wissenswertes
- Gescannte (nur-Bild-) PDFs haben keine Textschicht — das Ergebnis ist leer (OCR wird nicht ausgeführt; siehe OCR-Anleitung)
- Layout-Rekonstruktion ist Best-Effort; komplexe mehrspaltige Layouts weichen möglicherweise von der visuellen Lesereihenfolge ab
- Eingebettete Schriftarten mit defekten ToUnicode-Mappings können verstümmelten Text erzeugen
- Text in Bildern wird nicht extrahiert (nur der tatsächliche Text-Inhaltsstrom wird gelesen)
FAQ
Häufig gestellte Fragen
Warum ist das Ergebnis leer?
Das PDF ist höchstwahrscheinlich gescannt (nur-Bild) oder der Text wurde in Bilder eingebettet. Es gibt keinen Text im Inhaltsstrom zu extrahieren. Die Lösung ist OCR — siehe „So machen Sie ein PDF durchsuchbar“ für vertrauenswürdige lokale OCR-Werkzeuge. IXPDF täuscht kein OCR im Browser vor (die Genauigkeit ist nicht zuverlässig genug).
Funktioniert das bei verschlüsselten PDFs?
Nein. Wenn das PDF passwortgeschützt ist, zeigt das Werkzeug einen „verschlüsselt“-Fehler. Entschlüsseln Sie die Datei zuerst und extrahieren Sie dann den Text.
Was bewirkt „Layout erhalten“?
Wenn aktiviert, fügt das Werkzeug Zeilenumbrüche basierend auf der y-Position der Textelemente ein und erzeugt Text näher am visuellen Layout. Wenn deaktiviert, werden Textelemente mit Leerzeichen verbunden, was besser für Volltextsuche und Kopieren-Einfügen ist.
Ist der extrahierte Text korrekt?
Für PDFs mit echter Textschicht (nicht gescannt) entspricht der extrahierte Text dem, was Sie sehen. PDFs mit defekter Schriftartcodierung (fehlendes ToUnicode-Mapping) können verstümmelte Zeichen erzeugen — dies ist eine Eigenschaft der Datei, kein Fehler des Werkzeugs.
Kann ich Text nur aus bestimmten Seiten extrahieren?
Ja. Geben Sie einen Seitenbereich wie 1,3,5-7 in das Feld „Seitenbereich“ ein. Nur diese Seiten werden in der angegebenen Reihenfolge extrahiert.