Saltar al contenido
100 % local · 0 KB subidosComprimir PDF

¿Por qué no puedo seleccionar texto en un PDF?

🔒 Tus archivos nunca salen de tu dispositivo. Todo el procesamiento ocurre localmente en tu navegador.

Si no puedes seleccionar texto en un PDF — hacer clic y arrastrar sobre una palabra no resalta nada — el texto no está en el flujo de contenido del archivo. Eso normalmente significa una de cuatro cosas: el PDF es una imagen escaneada, el texto se incrustó en una imagen al exportar el archivo, el archivo se aplanó de forma que perdió la capa de texto, o la codificación de fuente está rota. La solución para las tres primeras es OCR. Esta guía explica cómo distinguir qué causa aplica y qué hacer.

Las 4 causas comunes

1. El PDF es escaneado (solo imagen)

La causa más común. Un documento escaneado es una fotografía de papel — cada página es una gran imagen. No hay texto en el flujo de contenido, así que nada que seleccionar. Los escáneres producen PDFs solo imagen por defecto; la opción "PDF buscable" en el software del escáner es la que añade una capa de texto vía OCR al escanear.

Cómo comprobarlo: amplía al 400%. Si el texto se pixela (ves bordes dentados alrededor de las formas de las letras), es una imagen. El texto real permanece nítido a cualquier ampliación porque se renderiza desde contornos de fuente. También prueba Ctrl+F /Cmd+F — si Buscar no localiza una palabra que ves claramente, el archivo no tiene capa de texto.

Solución: ejecuta OCR para añadir una capa de texto buscable. Consulta Cómo hacer un PDF buscable para las herramientas que hacen esto localmente.

2. El texto se incrustó en una imagen

Algunas aplicaciones exportan PDFs donde el texto se rasteriza — convertido a píxeles e incrustado como imagen, aunque el origen fuera texto real. Esto ocurre con controladores "Imprimir a PDF" que rasterizan todo, con exportadores de presentaciones que aplanan el texto sobre imágenes de fondo, y con PDFs que han pasado por un paso "aplanar" que convierte todo el contenido a imágenes.

Cómo comprobarlo: igual que el escaneado — amplía al 400% y busca pixelación. El archivo pudo ser originalmente un PDF de texto real; la rasterización ocurrió durante la exportación.

Solución: re-exporta desde la aplicación de origen con el texto preservado como texto (no rasterizado). Si no tienes el origen, ejecuta OCR sobre el archivo existente.

3. El PDF se aplanó

El aplanamiento convierte campos de formulario, anotaciones y a veces texto en contenido estático. Algunas operaciones de aplanamiento preservan la capa de texto; otras rasterizan todo. Si el paso de aplanamiento rasterizó, el resultado es solo imagen y no seleccionable.

Cómo comprobarlo: prueba de ampliación de nuevo. Si el texto sigue nítido al 400% pero no puedes seleccionarlo, el aplanamiento preservó el texto como contornos (formas vectoriales) en lugar de caracteres — raro pero posible. Si está pixelado, el aplanamiento rasterizó.

Solución: vuelve a aplanar con una herramienta que preserva la capa de texto, o re-exporta desde el origen. ConsultaCómo aplanar un PDF para la diferencia entre aplanamiento que preserva texto y que rasteriza.

4. Codificación de fuente rota (ToUnicode ausente)

La causa más rara. El texto existe en el flujo de contenido y se renderiza correctamente, pero el mapeo ToUnicode de la fuente falta o está mal. Los visores pueden mostrar los glifos (tienen los contornos de fuente) pero no pueden mapearlos de vuelta a caracteres Unicode para selección, copia o búsqueda. Ves el texto pero no puedes seleccionarlo.

Cómo comprobarlo: el texto se ve nítido a cualquier ampliación (es texto real, no una imagen) pero no puedes seleccionarlo ni copiarlo. Buscar también falla. Esto es común con PDFs generados por herramientas CAD antiguas o exportadores de nicho.

Solución: re-exporta desde el origen con mapeo Unicode correcto. Si no tienes el origen, ejecuta OCR — añadirá una capa de texto nueva con Unicode correcto, reemplazando la rota.

IXPDF no puede realizar OCR en el navegador
OCR (reconocimiento óptico de caracteres) está marcado Investigación Requerida según AGENTS.md §16. Existen motores OCR basados en navegador (Tesseract.js, OCRad.js) pero su precisión en escaneos reales no es suficientemente fiable para publicar — malinterpretan fuentes comunes, struggle con diseños multicolumna y producen texto peor que ningún texto para búsqueda y accesibilidad. No publicaremos una herramienta que devuelva silenciosamente texto equivocado. ConsultaCómo hacer un PDF buscable para herramientas OCR locales de confianza.

Lista de diagnóstico rápido

  1. Intenta seleccionar una palabra. Haz clic y arrastra sobre una palabra. Si nada se resalta, el texto no está en el flujo de contenido.
  2. Amplía al 400%. Si el texto se pixela, es una imagen (escaneado, rasterizado o aplanado a imagen). Si permanece nítido, es texto real con codificación rota.
  3. Prueba Buscar (Ctrl+F / Cmd+F). Si Buscar no localiza una palabra que ves, el archivo no tiene capa de texto buscable.
  4. Comprueba el tamaño del archivo. Los PDFs escaneados suelen ser grandes (una imagen de página completa por página). Un archivo pequeño con texto no seleccionable es más probable un caso de codificación rota.
  5. Aplica OCR si lo necesitas. Usa una herramienta OCR local para añadir una capa de texto buscable.

Una prueba rápida que puedes hacer ahora mismo

Si tu PDF se creó desde un documento escaneado, la extracción de texto devolverá vacío. Prueba la herramienta PDF a Texto de IXPDF — suelta tu archivo, ejecútala e inspecciona el resultado. Si el texto extraído es vacío, tu PDF está escaneado (o rasterizado) y necesita OCR (reconocimiento óptico de caracteres) para hacer el texto seleccionable; consultaCómo hacer un PDF buscable para opciones OCR locales de confianza. Si la herramientadevuelve texto pero sigues sin poder seleccionarlo en el PDF original, la causa es probablemente codificación de fuente rota (causa 4 arriba) — la capa de texto existe, pero el visor no puede mapear glifos de vuelta a Unicode.

Por qué OCR es la solución (y no solo un apaño)

Para PDFs escaneados, rasterizados y con codificación rota, OCR es la única solución — no hay texto original que recuperar. OCR analiza la imagen, reconoce las formas de las letras y escribe una capa de texto nueva en el PDF. El resultado es un "PDF buscable": la imagen original permanece visible (así el diseño y las firmas se preservan), y el texto reconocido se sitúa detrás como una capa invisible para selección, copia y búsqueda.

La calidad del OCR determina la calidad del resultado. Los motores OCR modernos (Tesseract 5, ABBYY FineReader, el OCR de Adobe Acrobat) son buenos en escaneos limpios de 300 DPI de fuentes comunes. Strugglen con escritura a mano, escaneos de baja resolución, fuentes decorativas y diseños multicolumna con texto e imágenes mezclados. Siempre revisa el texto reconocido antes de confiar en él.

Errores comunes

  • Asumir que el PDF está "cifrado" o "protegido". El texto no seleccionable casi nunca es una característica de seguridad. Normalmente es un archivo escaneado. Compruébalo abriéndolo en Acrobat Reader — si no hay restricciones listadas en Archivo > Propiedades > Seguridad, el archivo no está protegido.
  • Usar un servicio OCR online gratis para un documento sensible. El archivo se sube a un servidor. Usa una herramienta local — Tesseract, Acrobat o macOS Live Text.
  • Confiar en la salida de OCR sin revisar. OCR malinterpreta. Si estás copiando texto en un contrato o una cita, verifica cada palabra contra la imagen.
  • Re-escanear en lugar de re-exportar. Si tienes el documento de origen (Word, PowerPoint, InDesign), re-exporta como PDF — el texto será real y seleccionable. Re-escanear es un último recurso.

Haz tu PDF buscable

IXPDF no puede hacer OCR en el navegador hoy — la precisión no es suficientemente buena para publicar. Consulta nuestra guía para herramientas OCR locales de confianza que se ejecutan en tu máquina sin subir tu archivo.

Conocer las opciones de OCR