Fusionner des PDF
Réunir plusieurs PDF en un seul fichier.
Extraire le texte brut d’un PDF.
Ils se ressemblent à l’écran et se comportent de façon opposée.
Un PDF produit par un traitement de texte ou un logiciel de mise en page contient du vrai texte. Il se sélectionne, se cherche, et s’extrait ici.
Un PDF issu d’un scanner ou d’une photo contient des images de pages. Il n’y a rien à sélectionner, parce qu’il n’y a pas de texte — seulement une image sur laquelle du texte est visible.
Le test prend deux secondes : ouvrez le PDF et essayez de sélectionner un mot. Si vous n’y arrivez pas, c’est un scan et cet outil ne donnera rien. Utilisez la reconnaissance optique.
Il existe une forme intermédiaire : un scan sous lequel une couche de texte invisible a été ajoutée par reconnaissance. Elle est cherchable, et cet outil fonctionne — en héritant des erreurs commises par la reconnaissance.
Un PDF ne stocke pas des paragraphes. Il stocke la position de chaque fragment de texte sur la page.
D’où un résultat parfois désordonné. L’ordre des fragments dans le fichier n’est pas nécessairement l’ordre de lecture, et sur deux colonnes le texte s’entremêle régulièrement.
Ce qui se perd presque toujours : les colonnes, la structure des tableaux, les en-têtes et pieds de page qui atterrissent au milieu du texte, et les traits d’union de fin de ligne qui restent plantés dans les mots.
Pour un document courant sur une seule colonne, le résultat est bon. Pour un rapport annuel avec colonnes et tableaux, une reprise est inévitable.
Le plus fréquent : pouvoir chercher ou réutiliser sans retaper.
Utile pour reprendre une citation d’un rapport, extraire une adresse d’un courrier, reverser le texte d’un vieux PDF dans un nouveau document, ou compter les mots.
Moins utile si vous attendez une conversion « PDF vers Word ». Vous obtenez le texte, pas la mise en page. Pour un document modifiable qui conserve la présentation, il s’agit d’une autre conversion, dont le résultat est rarement propre.
Sur les documents confidentiels, retenez ceci : un texte masqué dans le PDF par un aplat coloré ressort ici tel quel. C’est exactement pourquoi un aplat n’est pas une méthode sûre pour caviarder.
Votre PDF est un scan. Essayez de sélectionner un mot dedans ; si c’est impossible, passez par la reconnaissance optique.
Non, vous obtenez du texte brut. Colonnes et tableaux sont perdus.
Sur plusieurs colonnes, le texte sort dans l’ordre du fichier, pas dans l’ordre de lecture.
Vous obtenez le texte, pas la mise en page. C’est une autre conversion.
S’il est simplement recouvert d’un aplat, oui. D’où le danger de cette méthode.
Non.