PDF in Testo
Estrai il testo da un PDF. I tuoi file non lasciano mai il tuo dispositivo — tutta l'elaborazione avviene in locale nel tuo browser.
Trascina qui il tuo PDF
o clicca per scegliere un file
I tuoi file non lasciano mai il tuo dispositivo.
Extracts the text content stream of each page. Scanned (image-only) PDFs have no text layer — the result will be empty for those files.
PDF in Testo estrae il flusso di contenuto testuale di ogni pagina usando PDF.js in un Web Worker. Il risultato viene mostrato in un'anteprima nella pagina e offerto come download .txt, con un pulsante copia-negli-appunti per incollare in altre app. L'estrazione avviene interamente nel tuo browser — il tuo file non viene mai caricato. I PDF scansionati (solo immagine) non hanno un livello di testo e produrranno un risultato vuoto; lo strumento lo segnala onestamente invece di simulare OCR.
Come funziona
Come usare PDF in Testo
- 1Trascina il tuo PDF. Trascina e rilascia un file PDF nell'area di rilascio, oppure fai clic per scegliere un file dal tuo dispositivo.
- 2Imposta opzionalmente un intervallo di pagine. Inserisci pagine come 1,3,5-7 per estrarre il testo solo da quelle pagine. Lascia vuoto per tutte le pagine.
- 3Esegui PDF in Testo. Lo strumento legge il flusso di contenuto testuale di ogni pagina usando PDF.js in un Web Worker sul tuo dispositivo.
- 4Anteprima, copia o scarica. Il testo estratto viene mostrato in un'area di anteprima. Copialo negli appunti o scaricalo come file .txt.
Funzioni
Cosa fa questo strumento
- Estrae testo da tutte le pagine o da quelle selezionate
- Preservazione opzionale del layout (inserisce interruzioni di riga in base al layout della pagina)
- Anteprima nella pagina con dettaglio per pagina
- Copia negli appunti o scarica come .txt
- Nessun caricamento — viene eseguito interamente nel tuo browser
Limitazioni
Cose da sapere
- I PDF scansionati (solo immagine) non hanno un livello di testo — il risultato sarà vuoto (l'OCR non viene eseguito; consulta la guida OCR)
- La ricostruzione del layout è best-effort; i layout complessi multi-colonna potrebbero non corrispondere all'ordine di lettura visivo
- I caratteri incorporati con mappature ToUnicode rotte possono produrre testo illeggibile
- Il testo dentro le immagini non viene estratto (solo il flusso di contenuto testuale reale viene letto)
FAQ
Domande frequenti
Perché il risultato è vuoto?
Il PDF è probabilmente scansionato (solo immagine) o il testo è stato incorporato nelle immagini. Non c'è testo nel flusso di contenuto da estrarre. La soluzione è l'OCR — consulta Come rendere un PDF ricercabile per strumenti OCR locali affidabili. IXPDF non simula l'OCR nel browser (l'accuratezza non è sufficientemente affidabile per rilasciarla).
Funziona su PDF critografati?
No. Se il PDF è protetto da password, lo strumento mostra un errore "critografato". Decifra prima il file, poi estrai il testo.
Cosa fa "Preserva layout"?
Quando selezionato, lo strumento inserisce interruzioni di riga in base alla posizione y degli elementi di testo nella pagina, producendo testo più vicino al layout visivo. Quando deselezionato, gli elementi di testo vengono uniti con spazi, il che è migliore per la ricerca full-text e copia-incolla.
Il testo estratto è accurato?
Per PDF con un vero livello di testo (non scansionati), il testo estratto corrisponde a ciò che vedi. PDF con codifica dei caratteri rotta (mappatura ToUnicode mancante) possono produrre caratteri illeggibili — è una proprietà del file, non un bug dello strumento.
Posso estrarre testo solo da pagine specifiche?
Sì. Inserisci un intervallo di pagine come 1,3,5-7 nel campo Intervallo di pagine. Solo quelle pagine verranno estratte, nell'ordine elencato.
Il mio file viene caricato da qualche parte?
No. L'estrazione del testo avviene interamente nel tuo browser usando un Web Worker. Il tuo file e il testo estratto non lasciano mai il tuo dispositivo.