Vai al contenuto
100% locale · 0 KB caricatiComprimi PDF

Come rendere un PDF ricercabile

🔒 I tuoi file non lasciano mai il tuo dispositivo. Tutta l'elaborazione avviene localmente nel tuo browser.

Un PDF scansionato è una fotografia di carta — non c'è testo nel file, solo pixel. Non puoi cercare, selezionare, copiare né usare un lettore di schermo. Renderlo ricercabile significa eseguire OCR (riconoscimento ottico dei caratteri) per aggiungere uno strato di testo che si posiziona dietro l'immagine. Questa guida copre i tre tipi di output OCR, gli strumenti locali che lo fanno bene e perché IXPDF non fa OCR nel browser oggi.

IXPDF non può fare OCR nel browser oggi
Esistono motori OCR per browser (Tesseract.js, OCRad.js), ma la loro precisione su scansioni reali non è abbastanza affidabile per essere rilasciata. Interpretano male caratteri comuni, faticano su layout multicolonna e producono testo peggiore di nessun testo per ricerca e accessibilità. Non rilasceremo uno strumento che restituisce silenziosamente testo errato (AGENTS.md §16). È marcato Ricerca richiesta. Gli strumenti sotto si eseguono localmente sul tuo computer e non caricano il tuo file.

I tre tipi di output OCR

Gli strumenti OCR possono produrre tre tipi diversi di output. Quale vuoi dipende da cosa farai del risultato.

1. PDF ricercabile (immagine + testo invisibile)

Il più comune e generalmente la scelta giusta. L'immagine di pagina originale resta visibile — layout, firme, timbri, scrittura manoscritta appaiono esattamente come prima. Dietro l'immagine, OCR aggiunge uno strato di testo invisibile con i caratteri riconosciuti. Puoi cercare, selezionare, copiare e usare un lettore di schermo; ciò che vedi a schermo è la scansione originale. È ciò che producono Adobe Acrobat, Tesseract e ABBYY per default.

Meglio per: archiviare documenti scansionati dove l'apparenza originale conta (contratti, ricevute, lettere firmate).

2. PDF solo testo (testo riconosciuto, senza immagine)

OCR sostituisce l'immagine interamente con il testo riconosciuto. Il risultato è piccolo, interamente selezionabile e assomiglia a un PDF testo normale — ma il layout originale è approssimativo, e tutto il contenuto che OCR non ha potuto riconoscere (firme, timbri, scrittura manoscritta) è sparito.

Meglio per: quando hai bisogno solo del testo e l'apparenza originale non importa (es., estrarre il corpo di una lettera scansionata in un file ricercabile per una base di conoscenza).

3. PDF doppio strato (immagine + testo, entrambi visibili)

Un formato meno comune che mostra sia l'immagine originale sia il testo riconosciuto fianco a fianco, o sovrappone il testo sull'immagine con l'immagine attenuata. Usato in flussi legali e di archiviazione dove i revisori devono confrontare l'output OCR con l'originale per rilevare errori di riconoscimento. ABBYY FineReader e Adobe Acrobat Pro lo supportano.

Meglio per: revisione legale, controllo qualità di archiviazione, qualsiasi flusso dove la precisione OCR deve essere verificata contro la sorgente.

Strumenti OCR locali

Ogni strumento sotto si esegue sul tuo computer. Nessuno carica il tuo documento. Questo conta: un contratto scansionato, cartella medica o modulo fiscale non dovrebbe essere inviato a un servizio «OCR online gratuito» — a quel punto il contenuto è sul server di qualcun altro.

1. Adobe Acrobat Pro (a pagamento, lo standard oro)

Apri il PDF scansionato, poi Strumenti > Scansiona e OCR > Riconosci testo > In questo file. Scegli la lingua e il tipo di output (Immagine ricercabile è il default e generalmente corretto). L'OCR di Acrobat è il più preciso su scansioni reali, gestisce bene layout multicolonna e ti permette di correggere parole riconosciute male in linea. Lo svantaggio è il costo — Acrobat Pro è un abbonamento.

2. Tesseract (gratuito, open source, riga di comando)

Il motore OCR gratuito più preciso. Installa dail progetto GitHub di Tesseract o il tuo gestore pacchetti (brew install tesseract su macOS,apt install tesseract-ocr su Linux). Poi:

tesseract input.pdf output -l eng pdf

Questo produce output.pdf come PDF ricercabile con l'immagine originale e uno strato di testo inglese invisibile. Tesseract non è preciso come Acrobat su layout complessi ma è eccellente su scansioni pulite a colonna singola. Supporta più di 100 lingue — passa -l eng+fra per documenti misti inglese/francese.

3. Live Text di Anteprima su macOS (gratuito, macOS 12+)

Su macOS Monterey e successivi, Anteprima può riconoscere testo nei PDF scansionati e immagini via la funzione Live Text del sistema. Apri il PDF in Anteprima e puoi selezionare, copiare e cercare testo direttamente — macOS aggiunge lo strato di testo al volo. Per salvare la versione ricercabile, File > Esporta come PDF. Live Text è rapido e preciso su documenti in inglese ma limitato in supporto lingue rispetto a Tesseract.

4. ABBYY FineReader (a pagamento, alta precisione)

Uno strumento OCR commerciale noto per la sua alta precisione su scansioni difficili — scrittura manoscritta, basso contrasto, caratteri misti, layout multicolonna. Supporta output doppio strato per verifica. Usalo quando Tesseract non è abbastanza preciso e non puoi giustificare l'abbonamento Acrobat Pro. FineReader è un acquisto singolo, non un abbonamento.

Passo per passo: rendere un PDF ricercabile con Tesseract

  1. Installa Tesseract. Su macOS,brew install tesseract. Su Linux,apt install tesseract-ocr. Su Windows, scarica l'installer dal progetto GitHub di Tesseract.
  2. Installa i dati lingua. L'inglese è incluso per default. Per altre lingue, installa il pack di lingua corrispondente (es., brew install tesseract-lang su macOS).
  3. Apri un terminale. Naviga alla cartella contenente il PDF scansionato.
  4. Esegui OCR.tesseract input.pdf output -l eng pdf
  5. Verifica il risultato. Apri output.pdf, cerca una parola che vedi nell'immagine e prova a selezionare un paragrafo. Se ricerca e selezione funzionano, lo strato di testo è in posto.
  6. Rileggi. OCR fa errori. Copia un paragrafo in un editor di testo e confrontalo all'immagine. Correggi ogni cattivo riconoscimento critico nel documento sorgente se conti di affidarti al testo.

Precisione OCR: cosa aspettarsi

La precisione OCR dipende quasi interamente dalla qualità dell'immagine sorgente. Una scansione pulita a 300 DPI di una pagina stampata in un carattere comune (Arial, Times New Roman) sarà riconosciuta a 98–99 % di precisione caratteri. Una scansione a 150 DPI di una pagina fotocopiata con un carattere decorativo può scendere a 90 % o meno — è 1 carattere errato su 10, abbastanza per rompere ricerca e copia-incolla.

Cosa nuoce alla precisione: bassa risoluzione (sotto 200 DPI), inclinazione (pagine scansionate in angolo), rumore (macchie da un vetro di scanner sporco), caratteri misti, scrittura manoscritta, layout multicolonna, tabelle e testo su sfondi colorati. Se la tua scansione presenta uno di questi elementi, aspettati di rileggere attentamente.

Errori comuni

  • Usare un servizio OCR online gratuito per un documento sensibile. Il file è caricato verso un server. Usa uno strumento locale — Tesseract, Acrobat o Live Text di macOS.
  • Darsi fiducia all'output OCR senza rileggere. OCR fa errori. Se copi testo in un contratto, una citazione o un database, verifica ogni parola contro l'immagine.
  • Scegliere output solo testo quando hai bisogno di l'apparenza originale. L'OCR solo testo scarta l'immagine. Se firme, timbri o layout importano, usa l'output PDF ricercabile invece.
  • OCR-izzare un PDF che ha già testo. Se il file ha già uno strato di testo (testa con Ctrl+F), OCR è inutile e può degradare il testo esistente. Vedi Perché non posso selezionare testo in un PDF? per confermare che il file ha realmente bisogno di OCR.
  • Omettere il pack lingua. Tesseract usa inglese per default. OCR-izzare un documento francese con il modello inglese produce spazzatura. Passa sempre -l con la lingua corretta.

Modifica i metadati del tuo PDF ricercabile

Una volta che OCR ha aggiunto uno strato di testo, usa lo strumento Modificare metadati di IXPDF per definire titolo, autore, oggetto e parole chiave — localmente nel tuo browser, senza caricamento.

Apri Modificare metadati