Alle Tools laufen in deinem Browser — deine Dateien verlassen nie dein Gerät.
All tools154

Text

Text bereinigen

Zeilenumbrüche, überflüssige Leerzeichen und unsichtbare Zeichen entfernen.

Was es macht. Ein Text-Reiniger entfernt, was beim Kopieren aus einem PDF, einem Word-Dokument oder einer Webseite mitkommt: harte Zeilenumbrüche mitten im Satz, doppelte Leerzeichen, typografische Anführungszeichen, geschützte Leerzeichen und unsichtbares Unicode. Jede Korrektur lässt sich einzeln zuschalten, sodass du siehst, was sich ändert.
Läuft im BrowserKein UploadKeine AnmeldungFunktioniert offline

So benutzt du Text bereinigen

  1. Füg den Text ein, den du bereinigen willst.
  2. Schalt die Korrekturen zu, die du brauchst — jede wirkt sofort, und der Zähler zeigt, wie viele Zeichen sie entfernt hat.
  3. Kopier das Ergebnis.

Warum sieht aus einem PDF kopierter Text kaputt aus?

Weil ein PDF keine Absätze kennt. Es kennt Zeichen an Koordinaten.

Beim Erzeugen wird jede Textzeile dort platziert, wo sie auf dem Papier steht. Die Information, dass drei aufeinanderfolgende Zeilen ein Absatz sind, wird dabei nicht gespeichert — sie ergibt sich für das Auge aus dem Layout, nicht aus der Datei. Beim Kopieren wird deshalb jedes Zeilenende zu einem Umbruch, auch mitten im Satz.

Bei deutschen Texten kommt eine zweite Eigenheit dazu: Silbentrennung. Ein am Zeilenende getrenntes Wort bringt seinen Trennstrich mit, sodass aus „Ver-\nsicherung" beim Kopieren „Ver- sicherung" wird. Die Korrektur „Umbrüche zusammenführen" erkennt diesen Fall und setzt das Wort wieder zusammen, statt nur den Umbruch zu entfernen.

Was sind unsichtbare Zeichen und warum stören sie?

Zeichen ohne sichtbare Darstellung, die trotzdem zählen — beim Vergleichen, beim Suchen und beim Verarbeiten.

Was sind unsichtbare Zeichen und warum stören sie?
ZeichenCodepunktWoher es kommtWas es kaputt macht
Geschütztes LeerzeichenU+00A0HTML  , WordSuche, Trennung an " ", CSV-Verarbeitung
Schmales geschütztes LeerzeichenU+202FWord bei „z. B."Dasselbe, nur schwerer zu finden
Breitenloses LeerzeichenU+200BKopieren aus Web-AnwendungenZeichenkettenvergleich, exakte Treffer
Breitenloser VerbinderU+200DEmoji-SequenzenZeichenzählung
Byte-Order-MarkU+FEFFDatei-ExporteErste Spaltenüberschrift in CSV
Weiches TrennzeichenU+00ADWord, InDesignSuche nach dem ganzen Wort

Das schmale geschützte Leerzeichen ist im deutschen Satz der häufigste Störenfried, weil Word es automatisch in Abkürzungen wie „z. B." und „u. a." setzt. Es sieht aus wie ein normales Leerzeichen, ist aber ein anderes Zeichen — eine Suche nach „z. B." findet es dann nicht.

Anführungszeichen und Gedankenstriche

Deutsche Anführungszeichen sind nicht die englischen. Unten steht „ (U+201E), oben “ (U+201C) — die berühmten Gänsefüßchen unten und oben. Wer englische Autokorrektur auf deutschen Text loslässt, bekommt “…” und das sieht für jeden deutschen Leser falsch aus.

Beim Einfügen in ein System, das nur ASCII verträgt — ein altes Formular, eine CSV-Datei, ein Datenbankfeld — müssen sie zu geraden Anführungszeichen werden. Die Korrektur „Typografie vereinfachen" macht genau das, und zwar für beide Varianten sowie für die Guillemets »…«, die im Buchsatz üblich sind.

Beim Gedankenstrich ist es umgekehrt: Im Deutschen ist der Halbgeviertstrich – mit Leerzeichen davor und danach korrekt, nicht der Geviertstrich —, den das Englische ohne Leerzeichen setzt. Ein automatisch aus dem Englischen übernommener Geviertstrich ist eines der zuverlässigsten Zeichen dafür, dass ein Text übersetzt wurde.

Umlaute, die keine sind

Ein „ä" kann auf zwei Arten in einer Datei stehen: als ein Zeichen (U+00E4) oder als „a" plus ein kombinierendes Trema (U+0061 U+0308). Beide sehen identisch aus.

Praktisch trifft man das bei Dateinamen von macOS, das historisch die zerlegte Form verwendet. Kopiert man solche Namen in eine Tabelle und sucht nach „Müller", findet man den zerlegten „Müller" nicht — die Suche vergleicht Zeichen, und da stehen unterschiedliche.

Die Korrektur „Unicode normalisieren" führt beides auf die zusammengesetzte Form zurück. Wer schon einmal eine Stunde damit verbracht hat, warum ein SVERWEIS zwei offensichtlich gleiche Namen nicht findet, kennt den Grund jetzt.

Was die einzelnen Optionen tun

Jede Option ist eine einzelne Änderung. Nichts wird stillschweigend zusätzlich gemacht.

  • Umbrüche zusammenführen — verbindet einzelne Zeilenumbrüche innerhalb eines Absatzes und behält Leerzeilen als Absatzgrenze. Erkennt Silbentrennung am Zeilenende.
  • Leerzeichen zusammenfassen — reduziert Folgen von Leerzeichen und Tabulatoren auf eines.
  • Zeilen beschneiden — entfernt Leerzeichen am Anfang und Ende jeder Zeile.
  • Typografie vereinfachen — ersetzt „…“, »…« und – durch ihre ASCII-Entsprechungen.
  • Unsichtbare Zeichen entfernen — löscht die Zeichen aus der Tabelle oben.
  • Unicode normalisieren — führt zerlegte Umlaute auf die zusammengesetzte Form zurück (NFC).
  • Leerzeilen entfernen — verdichtet mehrfache Leerzeilen auf eine.

Häufige Fragen

Wie entferne ich Zeilenumbrüche, behalte aber Absätze?

Nimm „Umbrüche zusammenführen". Einzelne Umbrüche verschwinden, Leerzeilen bleiben als Absatzgrenze erhalten.

Warum stimmen zwei scheinbar gleiche Zeichenketten nicht überein?

Fast immer ein unsichtbares Zeichen oder ein zerlegter Umlaut. Schalt „Unsichtbare Zeichen entfernen" und „Unicode normalisieren" zu.

Werden Emojis entfernt?

Nein. Nur die breitenlosen Verbinder darin können betroffen sein, was zusammengesetzte Emojis in ihre Einzelteile zerlegt.

Macht es meinen Code kaputt?

Möglich. „Leerzeichen zusammenfassen" zerstört Einrückungen in Python und YAML. Für Code nur die Optionen nehmen, die du wirklich brauchst.

Kann es aus einem PDF kopierten Text bereinigen?

Genau dafür ist es da. Umbrüche zusammenführen und Leerzeichen zusammenfassen lösen den Großteil des Problems, inklusive Silbentrennung.

Ändert es meine Originaldatei?

Nein. Du fügst Text ein und kopierst Text heraus. Es wird keine Datei gelesen oder geschrieben.

Wird mein Text hochgeladen?

Nein. Alle Korrekturen laufen in diesem Tab auf deinem Gerät.

Ratgeber zu Text bereinigen