PDF zusammenfügen
PDFs verbinden und Seiten per Ziehen neu ordnen. Nichts wird hochgeladen.
Text aus einem PDF als reinen Text herausholen.
Sie sehen am Bildschirm gleich aus und verhalten sich entgegengesetzt.
Ein PDF aus einer Textverarbeitung oder einem Satzprogramm enthält echten Text. Den kannst du markieren, durchsuchen und hier herausholen.
Ein PDF aus einem Scanner oder einem Handyfoto enthält Bilder von Seiten. Da ist nichts zu markieren, weil es keinen Text gibt — nur ein Bild, auf dem Text zu sehen ist.
Der Test dauert zwei Sekunden: Öffne das PDF und versuch, ein Wort zu markieren. Geht das nicht, ist es ein Scan und dieses Werkzeug liefert nichts. Nimm dann die Texterkennung.
Es gibt eine Zwischenform: ein Scan, unter den per Texterkennung eine unsichtbare Textebene gelegt wurde. Die ist durchsuchbar, und dieses Werkzeug funktioniert — mitsamt den Fehlern, die die Erkennung gemacht hat.
Ein PDF speichert keine Absätze. Es speichert, wo jedes Textstück auf der Seite steht.
Daher kommt das gelegentlich unordentliche Ergebnis. Die Reihenfolge der Textstücke in der Datei muss nicht die Lesereihenfolge sein, und bei zwei Spalten läuft es regelmäßig durcheinander.
Fast immer verloren gehen: Spalten, Tabellenstruktur, Kopf- und Fußzeilen, die mitten im Fließtext landen, und Trennstriche am Zeilenende, die im Wort stecken bleiben.
Bei einem gewöhnlichen einspaltigen Dokument ist das Ergebnis gut. Bei einem Geschäftsbericht mit Spalten und Tabellen ist Nacharbeit unvermeidlich.
Am häufigsten: etwas durchsuchbar machen oder weiterverwenden, ohne abzutippen.
Nützlich, um ein Zitat aus einem Bericht zu übernehmen, eine Adresse aus einem Brief zu holen, den Text eines alten PDFs in ein neues Dokument zu bringen oder Wörter zu zählen.
Weniger nützlich, wenn du eine Umwandlung „PDF zu Word" erwartest. Du bekommst den Text, nicht das Layout. Für ein bearbeitbares Dokument mit erhaltener Gestaltung ist das eine andere Umwandlung, die selten sauber ausfällt.
Bei vertraulichen Unterlagen ein wichtiger Punkt: Text, der im PDF mit einer farbigen Fläche verdeckt wurde, kommt hier unverändert heraus. Genau deshalb ist so eine Fläche kein sicheres Schwärzen.
Dein PDF ist ein Scan. Versuch, ein Wort darin zu markieren; geht das nicht, nimm die Texterkennung.
Nein, du bekommst reinen Text. Spalten und Tabellen gehen verloren.
Bei mehreren Spalten kommt er in der Reihenfolge der Datei, nicht in Lesereihenfolge.
Du bekommst den Text, nicht das Layout. Das ist eine andere Umwandlung.
Wenn er nur mit einer Fläche verdeckt ist: ja. Deshalb ist das kein sicheres Schwärzen.
Nein.