Aller au contenu
100 % local · 0 Ko téléversésCompresser un PDF

Pourquoi ne puis-je pas sélectionner de texte dans un PDF ?

🔒 Vos fichiers ne quittent jamais votre appareil. Tout le traitement se fait localement dans votre navigateur.

Si vous ne pouvez pas sélectionner de texte dans un PDF — cliquer et glisser sur un mot ne surligne rien — le texte n'est pas dans le flux de contenu du fichier. Cela signifie généralement l'une de quatre choses : le PDF est une image numérisée, le texte a été cuit dans une image à l'export, le fichier a été aplati d'une façon qui a perdu la couche de texte, ou l'encodage de police est cassé. La correction pour les trois premiers est OCR. Ce guide explique comment distinguer quelle cause s'applique et quoi faire.

Les 4 causes courantes

1. Le PDF est numérisé (image uniquement)

La cause la plus courante. Un document numérisé est une photographie de papier — chaque page est une grande image. Il n'y a pas de texte dans le flux de contenu, donc rien à sélectionner. Les scanners produisent des PDF image uniquement par défaut ; l'option « PDF cherchable » dans le logiciel du scanner est celle qui ajoute une couche de texte via OCR à la numérisation.

Comment vérifier : zoomez à 400 %. Si le texte se pixelise (vous voyez des bords dentelés autour des formes de lettres), c'est une image. Le texte réel reste net à tout zoom parce qu'il est rendu depuis des contours de police. Essayez aussi Ctrl+F / Cmd+F — si Rechercher ne localise pas un mot que vous voyez clairement, le fichier n'a pas de couche de texte.

Correction : exécutez OCR pour ajouter une couche de texte cherchable. Consultez Comment rendre un PDF cherchable pour les outils qui le font localement.

2. Le texte a été cuit dans une image

Certaines applications exportent des PDF où le texte est rasterisé — converti en pixels et incrusté comme image, même si la source était du texte réel. Cela arrive avec les pilotes « Imprimer vers PDF » qui rasterisent tout, avec les exporteurs de présentations qui aplatissent le texte sur des images de fond, et avec les PDF qui ont passé par une étape « aplatir » qui convertit tout le contenu en images.

Comment vérifier : comme numérisé — zoomez à 400 % et cherchez la pixelisation. Le fichier a pu être à l'origine un PDF de texte réel ; la rasterisation est survenue à l'export.

Correction : ré-exportez depuis l'application source avec le texte préservé comme texte (non rasterisé). Si vous n'avez pas la source, exécutez OCR sur le fichier existant.

3. Le PDF a été aplati

L'aplatissement convertit les champs de formulaire, annotations et parfois texte en contenu statique. Certaines opérations d'aplatissement préservent la couche de texte ; d'autres rasterisent tout. Si l'étape d'aplatissement a rasterisé, le résultat est image uniquement et non sélectionnable.

Comment vérifier : test de zoom à nouveau. Si le texte est encore net à 400 % mais que vous ne pouvez pas le sélectionner, l'aplatissement a préservé le texte comme contours (formes vectorielles) plutôt que caractères — rare mais possible. S'il est pixelisé, l'aplatissement a rasterisé.

Correction : ré-applatissez avec un outil qui préserve la couche de texte, ou ré-exportez depuis la source. ConsultezComment aplatir un PDFpour la différence entre aplatissement préservant le texte et rasterisant.

4. Encodage de police cassé (ToUnicode manquant)

La cause la plus rare. Le texte existe dans le flux de contenu et se rend correctement, mais le mappage ToUnicode de la police manque ou est erroné. Les visionneuses peuvent afficher les glyphes (elles ont les contours de police) mais ne peuvent pas les remapper en caractères Unicode pour sélection, copie ou recherche. Vous voyez le texte mais ne pouvez pas le sélectionner.

Comment vérifier : le texte semble net à tout zoom (c'est du texte réel, pas une image) mais vous ne pouvez pas le sélectionner ni le copier. Rechercher échoue aussi. C'est courant avec les PDF générés par de vieux outils CAO ou des exporteurs de niche.

Correction : ré-exportez depuis la source avec un mappage Unicode correct. Si vous n'avez pas la source, exécutez OCR — il ajoutera une couche de texte fraîche avec un Unicode correct, remplaçant celle cassée.

IXPDF ne peut pas effectuer d'OCR dans le navigateur
OCR (reconnaissance optique de caractères) est marqué Recherche Requise selon AGENTS.md §16. Des moteurs OCR basés navigateur (Tesseract.js, OCRad.js) existent mais leur précision sur des numérisations réelles n'est pas assez fiable pour publier — ils mésinterprètent les polices courantes, peinent sur les mises en page multi-colonnes, et produisent un texte pire que pas de texte du tout pour la recherche et l'accessibilité. Nous ne publierons pas un outil qui renvoie silencieusement du texte erroné. Consultez Comment rendre un PDF cherchable pour des outils OCR locaux fiables.

Liste de diagnostic rapide

  1. Essayez de sélectionner un mot. Cliquez et glissez sur un mot. Si rien ne se surligne, le texte n'est pas dans le flux de contenu.
  2. Zoomez à 400 %. Si le texte se pixelise, c'est une image (numérisé, rasterisé, ou aplati en image). S'il reste net, c'est du texte réel avec un encodage cassé.
  3. Essayez Rechercher (Ctrl+F / Cmd+F). Si Rechercher ne localise pas un mot que vous voyez, le fichier n'a pas de couche de texte cherchable.
  4. Vérifiez la taille du fichier. Les PDF numérisés sont généralement grands (une image pleine page par page). Un petit fichier avec du texte non sélectionnable est plus probablement un cas d'encodage cassé.
  5. Appliquez OCR si besoin. Utilisez un outil OCR local pour ajouter une couche de texte cherchable.

Un test rapide que vous pouvez exécuter maintenant

Si votre PDF a été créé depuis un document numérisé, l'extraction de texte renverra vide. Essayez l'outil PDF vers Texte d'IXPDF — déposez votre fichier, exécutez-le, et inspectez le résultat. Si le texte extrait est vide, votre PDF est numérisé (ou rasterisé) et a besoin d'OCR (reconnaissance optique de caractères) pour rendre le texte sélectionnable ; consultezComment rendre un PDF cherchable pour des options OCR locales fiables. Si l'outilrenvoie du texte mais que vous ne pouvez toujours pas le sélectionner dans le PDF original, la cause est probablement l'encodage de police cassé (cause 4 ci-dessus) — la couche de texte existe, mais le visionneuse ne peut pas remapper les glyphes en Unicode.

Pourquoi OCR est la correction (et pas juste un contournement)

Pour les PDF numérisés, rasterisés et à encodage cassé, OCR est la seule correction — il n'y a pas de texte original à récupérer. OCR analyse l'image, reconnaît les formes de lettres, et écrit une nouvelle couche de texte dans le PDF. Le résultat est un « PDF cherchable » : l'image original reste visible (donc la mise en page et les signatures sont préservées), et le texte reconnu se place derrière comme une couche invisible pour sélection, copie et recherche.

La qualité de l'OCR détermine la qualité du résultat. Les moteurs OCR modernes (Tesseract 5, ABBYY FineReader, l'OCR d'Adobe Acrobat) sont bons sur des numérisations propres à 300 DPI de polices courantes. Ils peinent sur l'écriture manuscrite, les numérisations basse résolution, les polices décoratives, et les mises en page multi-colonnes avec texte et images mélangés. Relisez toujours le texte reconnu avant de vous y fier.

Erreurs courantes

  • Supposer que le PDF est « chiffré » ou « protégé ». Le texte non sélectionnable n'est presque jamais une fonctionnalité de sécurité. C'est généralement un fichier numérisé. Vérifiez en ouvrant dans Acrobat Reader — s'il n'y a pas de restrictions listées dansFichier > Propriétés > Sécurité, le fichier n'est pas protégé.
  • Utiliser un service OCR en ligne gratuit pour un document sensible. Le fichier est téléversé vers un serveur. Utilisez un outil local — Tesseract, Acrobat, ou macOS Live Text.
  • Faire confiance à la sortie OCR sans relecture. OCR mésinterprète. Si vous copiez du texte dans un contrat ou une citation, vérifiez chaque mot contre l'image.
  • Re-numériser au lieu de ré-exporter. Si vous avez le document source (Word, PowerPoint, InDesign), ré-exportez en PDF — le texte sera réel et sélectionnable. Re-numériser est un dernier recours.

Rendez votre PDF cherchable

IXPDF ne peut pas faire d'OCR dans le navigateur aujourd'hui — la précision n'est pas assez bonne pour publier. Consultez notre guide pour des outils OCR locaux fiables qui s'exécutent sur votre machine sans téléverser votre fichier.

En savoir plus sur les options OCR