Alle Tools laufen in deinem Browser — deine Dateien verlassen nie dein Gerät.
All tools154

Bild

Bild in Text umwandeln (OCR)

Text aus Screenshots und Scans holen, in rund 100 Sprachen.

Was es macht. OCR — optische Zeichenerkennung — verwandelt Bilder von Text in bearbeitbaren Text. Dieses Werkzeug führt Tesseract als WebAssembly in deinem Browser aus und unterstützt rund 100 Sprachen. Bei einem sauberen Scan mit 300 dpi liegt die Genauigkeit typischerweise bei 96 bis 99 %. Dein Dokument wird nie hochgeladen.
Läuft im BrowserKein UploadKeine AnmeldungFunktioniert offline

So benutzt du Bild in Text umwandeln (OCR)

  1. Zieh ein Bild oder einen Screenshot mit Text auf das Feld. Das Sprachmodell wird beim ersten Mal geladen.
  2. Wähl die Sprache des Textes — bei falscher Wahl bricht die Genauigkeit stark ein.
  3. Kopier den erkannten Text oder lade ihn als .txt-Datei herunter.

Welche Genauigkeit ist realistisch?

Das hängt fast vollständig von der Vorlage ab, kaum von der Software.

Welche Genauigkeit ist realistisch?
VorlageTypische GenauigkeitHäufigster Fehler
Screenshot von Bildschirmtext98–99 %Fast keiner — die Pixel sind schon scharf
Flachbettscan mit 300 dpi96–99 %Gelegentliche Verwechslung von l / I / 1
Handyfoto einer gedruckten Seite88–95 %Perspektivische Verzerrung, ungleiche Ausleuchtung
Scan mit 150 dpi80–90 %Zeichen unterhalb der nötigen Auflösung
Fraktur mit lateinischem Modell20–50 %Selbstbewusster Unsinn statt Fehlermeldung

Die letzte Zeile ist die gefährlichste. Ein zu schwacher Scan liefert offensichtlichen Müll, den man bemerkt. Fraktur mit dem falschen Modell liefert flüssig lesbare, falsche Wörter — und die übersieht man beim Korrekturlesen.

Fraktur, und warum das deutsche Standardmodell daran scheitert

Alles, was in Deutschland vor etwa 1941 gedruckt wurde, steht mit hoher Wahrscheinlichkeit in Fraktur. Wer alte Bücher, Kirchenbücher, Zeitungen oder Familienpapiere digitalisiert, trifft unweigerlich darauf.

Das übliche deutsche Modell (deu) ist auf Antiqua trainiert und kennt Fraktur nicht. Es scheitert daran nicht mit einer Fehlermeldung, sondern rät: Das lange ſ wird zu f, das k zu t, das rundes-r zu einem Komma. Aus „Weſen" wird „Wefen", aus „Kraft" wird „Traft". Der Text bleibt lesbar und ist falsch.

Für Fraktur gibt es ein eigenes Modell. Wähl es explizit aus, wenn die Vorlage gebrochene Schrift zeigt — daran erkennbar, dass Großbuchstaben verschnörkelt sind und das kleine s in der Wortmitte wie ein f ohne Querstrich aussieht.

Kurrent und Sütterlin, also die deutschen Handschriften derselben Zeit, sind damit nicht abgedeckt. Handschrift ist für diese Art von OCR grundsätzlich außer Reichweite.

Wie werden die Ergebnisse besser?

Die Vorlage entscheidet. Fünf Minuten besser scannen bringt mehr als jede Nachbearbeitung.

  1. Mit 300 dpi scannen. Unter 200 dpi fallen Buchstabenstriche unter die Auflösung, die die Engine braucht. Über 400 dpi kostet Zeit ohne Gewinn.
  2. Die Seite gerade ausrichten. Schon drei Grad Schräglage verschlechtern die Zeilenzerlegung messbar.
  3. Gleichmäßig ausleuchten. Ein Schatten quer über die Seite ist für die Binarisierung schlimmer als gleichmäßig zu dunkel.
  4. In Graustufen scannen, nicht in Farbe. Farbrauschen erschwert die Trennung von Text und Hintergrund.
  5. Die richtige Sprache wählen. Bei Deutsch stehen Umlaute und ß im Modell; mit englischem Modell wird aus ü ein ii und aus ß ein B.
  6. Bei gebrochener Schrift das Fraktur-Modell nehmen — siehe oben.

Funktioniert es mit PDFs?

Nicht direkt — dieses Werkzeug erwartet ein Bild. Der Weg führt über zwei Schritte: erst das PDF in Bilder umwandeln, dann die Bilder durch die Texterkennung schicken.

Ein Hinweis vorab: Viele PDFs enthalten bereits eine Textebene und brauchen gar keine Erkennung. Lässt sich der Text im Betrachter markieren, ist er da — nimm dann das Werkzeug PDF zu Text, das den vorhandenen Text ausliest, statt ihn aus Pixeln neu zu raten. Das ist schneller und exakt statt nur genau.

Häufige Fragen

Kann es Handschrift lesen?

Nein. Tesseract ist auf Druckschrift trainiert. Kurrent und Sütterlin liegen weit außerhalb dessen, was diese Art von OCR leisten kann.

Bleibt das Layout erhalten?

Nur grob. Zeilen und Absätze bleiben meist, mehrspaltige Seiten und Tabellen laufen dagegen oft ineinander.

Wie lange dauert es?

Ein bis fünf Sekunden je Seite auf einem normalen Notebook, dazu einmalig der Download des Sprachmodells von etwa 10 bis 15 MB.

Wird mein Dokument hochgeladen?

Nein. Die Erkennung läuft als WebAssembly in diesem Tab. Nur das Sprachmodell wird geladen, und danach geht es auch offline.

Kann ich ein Foto eines Whiteboards erkennen lassen?

Nur wenn darauf gedruckter Text steht. Handschrift auf dem Whiteboard wird nicht erkannt.

Warum kam nur Unsinn heraus?

Fast immer die falsche Sprache oder gebrochene Schrift mit lateinischem Modell. Prüf beides, bevor du an der Vorlage zweifelst.

Gibt es eine Seitenbegrenzung?

Keine. Seiten werden nacheinander verarbeitet, sodass auch lange Dokumente durchlaufen — sie brauchen entsprechend Zeit.

Ratgeber zu Bild in Text umwandeln (OCR)