Tous les outils fonctionnent dans votre navigateur — vos fichiers ne quittent jamais votre appareil.
All tools154

PDF

PDF en texte

Extraire le texte brut d’un PDF.

Ce que fait cet outil. Cet outil extrait la couche de texte d’un PDF. Cela ne fonctionne que si elle existe : un PDF issu d’un scan ne contient pas de texte mais des images, et il faut alors passer par la reconnaissance optique.
Fonctionne dans le navigateurAucun envoiSans inscriptionFonctionne hors ligne

Comment utiliser PDF en texte

  1. Choisissez votre PDF.
  2. Sélectionnez toutes les pages ou une plage.
  3. Copiez le texte ou enregistrez-le.

Deux sortes de PDF

Ils se ressemblent à l’écran et se comportent de façon opposée.

Un PDF produit par un traitement de texte ou un logiciel de mise en page contient du vrai texte. Il se sélectionne, se cherche, et s’extrait ici.

Un PDF issu d’un scanner ou d’une photo contient des images de pages. Il n’y a rien à sélectionner, parce qu’il n’y a pas de texte — seulement une image sur laquelle du texte est visible.

Le test prend deux secondes : ouvrez le PDF et essayez de sélectionner un mot. Si vous n’y arrivez pas, c’est un scan et cet outil ne donnera rien. Utilisez la reconnaissance optique.

Il existe une forme intermédiaire : un scan sous lequel une couche de texte invisible a été ajoutée par reconnaissance. Elle est cherchable, et cet outil fonctionne — en héritant des erreurs commises par la reconnaissance.

Pourquoi la mise en forme disparaît

Un PDF ne stocke pas des paragraphes. Il stocke la position de chaque fragment de texte sur la page.

D’où un résultat parfois désordonné. L’ordre des fragments dans le fichier n’est pas nécessairement l’ordre de lecture, et sur deux colonnes le texte s’entremêle régulièrement.

Ce qui se perd presque toujours : les colonnes, la structure des tableaux, les en-têtes et pieds de page qui atterrissent au milieu du texte, et les traits d’union de fin de ligne qui restent plantés dans les mots.

Pour un document courant sur une seule colonne, le résultat est bon. Pour un rapport annuel avec colonnes et tableaux, une reprise est inévitable.

Usages courants

Le plus fréquent : pouvoir chercher ou réutiliser sans retaper.

Utile pour reprendre une citation d’un rapport, extraire une adresse d’un courrier, reverser le texte d’un vieux PDF dans un nouveau document, ou compter les mots.

Moins utile si vous attendez une conversion « PDF vers Word ». Vous obtenez le texte, pas la mise en page. Pour un document modifiable qui conserve la présentation, il s’agit d’une autre conversion, dont le résultat est rarement propre.

Sur les documents confidentiels, retenez ceci : un texte masqué dans le PDF par un aplat coloré ressort ici tel quel. C’est exactement pourquoi un aplat n’est pas une méthode sûre pour caviarder.

Questions fréquentes

Pourquoi n’obtiens-je aucun texte ?

Votre PDF est un scan. Essayez de sélectionner un mot dedans ; si c’est impossible, passez par la reconnaissance optique.

La mise en forme est-elle conservée ?

Non, vous obtenez du texte brut. Colonnes et tableaux sont perdus.

Pourquoi le texte est-il mélangé ?

Sur plusieurs colonnes, le texte sort dans l’ordre du fichier, pas dans l’ordre de lecture.

Puis-je convertir un PDF en Word ainsi ?

Vous obtenez le texte, pas la mise en page. C’est une autre conversion.

Le texte caviardé ressort-il ?

S’il est simplement recouvert d’un aplat, oui. D’où le danger de cette méthode.

Mon PDF est-il téléversé ?

Non.