Como tornar um PDF pesquisável
Um PDF digitalizado é uma fotografia de papel — não há texto no arquivo, apenas pixels. Você não pode buscar, selecionar, copiar nem usar um leitor de tela. Torná-lo pesquisável significa executar OCR (reconhecimento óptico de caracteres) para adicionar uma camada de texto que se coloca atrás da imagem. Este guia cobre os três tipos de saída OCR, as ferramentas locais que fazem isso bem e por que o IXPDF não faz OCR no navegador hoje.
Os três tipos de saída OCR
Ferramentas OCR podem produzir três tipos diferentes de saída. Qual você quer depende do que fará com o resultado.
1. PDF pesquisável (imagem + texto invisível)
O mais comum e geralmente a escolha certa. A imagem de página original permanece visível — formatação, assinaturas, carimbos, escrita à mão aparecem exatamente como antes. Atrás da imagem, OCR adiciona uma camada de texto invisível com os caracteres reconhecidos. Você pode buscar, selecionar, copiar e usar um leitor de tela; o que você vê na tela é a digitalização original. É o que produzem Adobe Acrobat, Tesseract e ABBYY por padrão.
Melhor para: arquivar documentos digitalizados onde a aparência original importa (contratos, recibos, cartas assinadas).
2. PDF texto apenas (texto reconhecido, sem imagem)
OCR substitui a imagem inteiramente pelo texto reconhecido. O resultado é pequeno, inteiramente selecionável e se parece com um PDF de texto normal — mas a formatação original é aproximada, e qualquer conteúdo que OCR não conseguiu reconhecer (assinaturas, carimbos, escrita à mão) desapareceu.
Melhor para: quando você precisa apenas do texto e a aparência original não importa (p. ex., extrair o corpo de uma carta digitalizada em um arquivo pesquisável para uma base de conhecimento).
3. PDF camada dupla (imagem + texto, ambos visíveis)
Um formato menos comum que mostra tanto a imagem original quanto o texto reconhecido lado a lado, ou sobrepõe o texto na imagem com a imagem atenuada. Usado em fluxos jurídicos e de arquivamento onde os revisores devem comparar a saída OCR ao original para detectar os erros de reconhecimento. ABBYY FineReader e Adobe Acrobat Pro o suportam.
Melhor para: revisão jurídica, controle de qualidade de arquivamento, qualquer fluxo onde a precisão OCR deve ser verificada contra a fonte.
Ferramentas OCR locais
Cada ferramenta abaixo roda na sua máquina. Nenhuma envia seu documento. Isso importa: um contrato digitalizado, prontuário médico ou formulário fiscal não deveria ser enviado a um serviço « OCR online grátis » — nesse ponto o conteúdo está no servidor de outra pessoa.
1. Adobe Acrobat Pro (pago, o padrão ouro)
Abra o PDF digitalizado, depois Ferramentas > Digitalizar e OCR > Reconhecer texto > Neste arquivo. Escolha a linguagem e o tipo de saída (Imagem pesquisável é o padrão e geralmente correto). O OCR do Acrobat é o mais preciso em digitalizações reais, lida bem com formatações multicolunas e permite corrigir palavras mal reconhecidas inline. A desvantagem é o custo — Acrobat Pro é uma assinatura.
2. Tesseract (grátis, open source, linha de comando)
O motor OCR gratuito mais preciso. Instale desdeo projeto GitHub do Tesseract ou seu gerenciador de pacotes (brew install tesseract no macOS,apt install tesseract-ocr no Linux). Depois:
tesseract input.pdf output -l eng pdf
Isso produz output.pdf como um PDF pesquisável com a imagem original e uma camada de texto inglês invisível. O Tesseract não é tão preciso quanto o Acrobat em formatações complexas mas é excelente em digitalizações limpas de coluna única. Ele suporta mais de 100 idiomas — passe -l eng+fra para documentos mistos inglês/francês.
3. Live Text do Preview no macOS (grátis, macOS 12+)
No macOS Monterey e posteriores, o Preview pode reconhecer texto em PDFs digitalizados e imagens via a função Live Text do sistema. Abra o PDF no Preview e você pode selecionar, copiar e buscar texto diretamente — o macOS adiciona a camada de texto na hora. Para salvar a versão pesquisável, Arquivo > Exportar como PDF. O Live Text é rápido e preciso em documentos em inglês mas limitado em suporte a idiomas comparado ao Tesseract.
4. ABBYY FineReader (pago, alta precisão)
Uma ferramenta OCR comercial conhecida por sua alta precisão em digitalizações difíceis — escrita à mão, baixo contraste, fontes mistas, formatações multicolunas. Suporta saída camada dupla para verificação. Use-a quando o Tesseract não é suficientemente preciso e você não pode justificar a assinatura do Acrobat Pro. FineReader é uma compra única, não uma assinatura.
Passo a passo: tornar um PDF pesquisável com Tesseract
- Instale o Tesseract. No macOS,
brew install tesseract. No Linux,apt install tesseract-ocr. No Windows, baixe o instalador desde o projeto GitHub do Tesseract. - Instale os dados de idioma. O inglês é incluído por padrão. Para outros idiomas, instale o pacote de idioma correspondente (p. ex.,
brew install tesseract-langno macOS). - Abra um terminal. Navegue até a pasta contendo o PDF digitalizado.
- Execute OCR.
tesseract input.pdf output -l eng pdf - Verifique o resultado. Abra
output.pdf, busque uma palavra que você vê na imagem e tente selecionar um parágrafo. Se a busca e a seleção funcionam, a camada de texto está em lugar. - Revise. OCR comete erros. Copie um parágrafo em um editor de texto e compare-o à imagem. Corrija qualquer mau reconhecimento crítica no documento fonte se você pretende confiar no texto.
Precisão OCR: o que esperar
A precisão OCR depende quase inteiramente da qualidade da imagem fonte. Uma digitalização limpa a 300 DPI de uma página impressa em uma fonte comum (Arial, Times New Roman) se reconhecerá a 98–99 % de precisão de caracteres. Uma digitalização a 150 DPI de uma página fotocopiada com uma fonte decorativa pode cair a 90 % ou menos — isso é 1 caractere errado em 10, suficiente para quebrar a busca e o copiar-colar.
O que prejudica a precisão: baixa resolução (abaixo de 200 DPI), inclinação (páginas digitalizadas em ângulo), ruído (speckles de um vidro de scanner sujo), fontes mistas, escrita à mão, formatações multicolunas, tabelas e texto sobre fundos coloridos. Se sua digitalização apresenta qualquer um desses, espere revisar cuidadosamente.
Erros comuns
- Usar um serviço OCR online grátis para um documento sensível. O arquivo é enviado para um servidor. Use uma ferramenta local — Tesseract, Acrobat ou Live Text do macOS.
- Confiar na saída OCR sem revisar. OCR comete erros. Se você copia texto em um contrato, uma citação ou uma base de dados, verifique cada palavra contra a imagem.
- Escolher saída texto apenas quando você precisa de a aparência original. OCR texto apenas descarta a imagem. Se assinaturas, carimbos ou formatação importam, use a saída PDF pesquisável no lugar.
- OCRizar um PDF que já tem texto. Se o arquivo tem já uma camada de texto (teste com Ctrl+F), OCR é inútil e pode degradar o texto existente. Ver Por que não consigo selecionar texto em um PDF? para confirmar que o arquivo realmente precisa de OCR.
- Omitir o pacote de idioma. O Tesseract usa inglês por padrão. OCRizar um documento português com o modelo inglês produz lixo. Passe sempre
-lcom o idioma correto.
Edite os metadados do seu PDF pesquisável
Uma vez que OCR adicionou uma camada de texto, use a ferramenta Editar metadados do IXPDF para definir o título, o autor, o assunto e as palavras-chave — localmente no seu navegador, sem envio.
Abrir Editar metadados