Alle Tools laufen in deinem Browser — deine Dateien verlassen nie dein Gerät.
All tools154

PDF

PDF in Text

Text aus einem PDF als reinen Text herausholen.

Was es macht. Dieses Werkzeug holt die Textebene aus einem PDF. Das funktioniert nur, wenn es sie gibt: Ein PDF aus einem Scan enthält keinen Text, sondern Bilder, und dafür brauchst du Texterkennung.
Läuft im BrowserKein UploadKeine AnmeldungFunktioniert offline

So benutzt du PDF in Text

  1. Wähl dein PDF.
  2. Wähl alle Seiten oder einen Bereich.
  3. Kopier den Text oder speicher ihn.

Zwei Sorten PDF

Sie sehen am Bildschirm gleich aus und verhalten sich entgegengesetzt.

Ein PDF aus einer Textverarbeitung oder einem Satzprogramm enthält echten Text. Den kannst du markieren, durchsuchen und hier herausholen.

Ein PDF aus einem Scanner oder einem Handyfoto enthält Bilder von Seiten. Da ist nichts zu markieren, weil es keinen Text gibt — nur ein Bild, auf dem Text zu sehen ist.

Der Test dauert zwei Sekunden: Öffne das PDF und versuch, ein Wort zu markieren. Geht das nicht, ist es ein Scan und dieses Werkzeug liefert nichts. Nimm dann die Texterkennung.

Es gibt eine Zwischenform: ein Scan, unter den per Texterkennung eine unsichtbare Textebene gelegt wurde. Die ist durchsuchbar, und dieses Werkzeug funktioniert — mitsamt den Fehlern, die die Erkennung gemacht hat.

Warum die Formatierung verloren geht

Ein PDF speichert keine Absätze. Es speichert, wo jedes Textstück auf der Seite steht.

Daher kommt das gelegentlich unordentliche Ergebnis. Die Reihenfolge der Textstücke in der Datei muss nicht die Lesereihenfolge sein, und bei zwei Spalten läuft es regelmäßig durcheinander.

Fast immer verloren gehen: Spalten, Tabellenstruktur, Kopf- und Fußzeilen, die mitten im Fließtext landen, und Trennstriche am Zeilenende, die im Wort stecken bleiben.

Bei einem gewöhnlichen einspaltigen Dokument ist das Ergebnis gut. Bei einem Geschäftsbericht mit Spalten und Tabellen ist Nacharbeit unvermeidlich.

Wofür es taugt

Am häufigsten: etwas durchsuchbar machen oder weiterverwenden, ohne abzutippen.

Nützlich, um ein Zitat aus einem Bericht zu übernehmen, eine Adresse aus einem Brief zu holen, den Text eines alten PDFs in ein neues Dokument zu bringen oder Wörter zu zählen.

Weniger nützlich, wenn du eine Umwandlung „PDF zu Word" erwartest. Du bekommst den Text, nicht das Layout. Für ein bearbeitbares Dokument mit erhaltener Gestaltung ist das eine andere Umwandlung, die selten sauber ausfällt.

Bei vertraulichen Unterlagen ein wichtiger Punkt: Text, der im PDF mit einer farbigen Fläche verdeckt wurde, kommt hier unverändert heraus. Genau deshalb ist so eine Fläche kein sicheres Schwärzen.

Häufige Fragen

Warum bekomme ich keinen Text?

Dein PDF ist ein Scan. Versuch, ein Wort darin zu markieren; geht das nicht, nimm die Texterkennung.

Bleibt die Formatierung erhalten?

Nein, du bekommst reinen Text. Spalten und Tabellen gehen verloren.

Warum ist der Text durcheinander?

Bei mehreren Spalten kommt er in der Reihenfolge der Datei, nicht in Lesereihenfolge.

Kann ich damit ein PDF in Word umwandeln?

Du bekommst den Text, nicht das Layout. Das ist eine andere Umwandlung.

Kommt geschwärzter Text mit heraus?

Wenn er nur mit einer Fläche verdeckt ist: ja. Deshalb ist das kein sicheres Schwärzen.

Wird mein PDF hochgeladen?

Nein.