Wörter- und Zeichenzähler
Wörter, Zeichen, Sätze und Lesezeit — live beim Tippen.
Text
Zeilenumbrüche, überflüssige Leerzeichen und unsichtbare Zeichen entfernen.
Weil ein PDF keine Absätze kennt. Es kennt Zeichen an Koordinaten.
Beim Erzeugen wird jede Textzeile dort platziert, wo sie auf dem Papier steht. Die Information, dass drei aufeinanderfolgende Zeilen ein Absatz sind, wird dabei nicht gespeichert — sie ergibt sich für das Auge aus dem Layout, nicht aus der Datei. Beim Kopieren wird deshalb jedes Zeilenende zu einem Umbruch, auch mitten im Satz.
Bei deutschen Texten kommt eine zweite Eigenheit dazu: Silbentrennung. Ein am Zeilenende getrenntes Wort bringt seinen Trennstrich mit, sodass aus „Ver-\nsicherung" beim Kopieren „Ver- sicherung" wird. Die Korrektur „Umbrüche zusammenführen" erkennt diesen Fall und setzt das Wort wieder zusammen, statt nur den Umbruch zu entfernen.
Zeichen ohne sichtbare Darstellung, die trotzdem zählen — beim Vergleichen, beim Suchen und beim Verarbeiten.
| Zeichen | Codepunkt | Woher es kommt | Was es kaputt macht |
|---|---|---|---|
| Geschütztes Leerzeichen | U+00A0 | HTML , Word | Suche, Trennung an " ", CSV-Verarbeitung |
| Schmales geschütztes Leerzeichen | U+202F | Word bei „z. B." | Dasselbe, nur schwerer zu finden |
| Breitenloses Leerzeichen | U+200B | Kopieren aus Web-Anwendungen | Zeichenkettenvergleich, exakte Treffer |
| Breitenloser Verbinder | U+200D | Emoji-Sequenzen | Zeichenzählung |
| Byte-Order-Mark | U+FEFF | Datei-Exporte | Erste Spaltenüberschrift in CSV |
| Weiches Trennzeichen | U+00AD | Word, InDesign | Suche nach dem ganzen Wort |
Das schmale geschützte Leerzeichen ist im deutschen Satz der häufigste Störenfried, weil Word es automatisch in Abkürzungen wie „z. B." und „u. a." setzt. Es sieht aus wie ein normales Leerzeichen, ist aber ein anderes Zeichen — eine Suche nach „z. B." findet es dann nicht.
Deutsche Anführungszeichen sind nicht die englischen. Unten steht „ (U+201E), oben “ (U+201C) — die berühmten Gänsefüßchen unten und oben. Wer englische Autokorrektur auf deutschen Text loslässt, bekommt “…” und das sieht für jeden deutschen Leser falsch aus.
Beim Einfügen in ein System, das nur ASCII verträgt — ein altes Formular, eine CSV-Datei, ein Datenbankfeld — müssen sie zu geraden Anführungszeichen werden. Die Korrektur „Typografie vereinfachen" macht genau das, und zwar für beide Varianten sowie für die Guillemets »…«, die im Buchsatz üblich sind.
Beim Gedankenstrich ist es umgekehrt: Im Deutschen ist der Halbgeviertstrich – mit Leerzeichen davor und danach korrekt, nicht der Geviertstrich —, den das Englische ohne Leerzeichen setzt. Ein automatisch aus dem Englischen übernommener Geviertstrich ist eines der zuverlässigsten Zeichen dafür, dass ein Text übersetzt wurde.
Ein „ä" kann auf zwei Arten in einer Datei stehen: als ein Zeichen (U+00E4) oder als „a" plus ein kombinierendes Trema (U+0061 U+0308). Beide sehen identisch aus.
Praktisch trifft man das bei Dateinamen von macOS, das historisch die zerlegte Form verwendet. Kopiert man solche Namen in eine Tabelle und sucht nach „Müller", findet man den zerlegten „Müller" nicht — die Suche vergleicht Zeichen, und da stehen unterschiedliche.
Die Korrektur „Unicode normalisieren" führt beides auf die zusammengesetzte Form zurück. Wer schon einmal eine Stunde damit verbracht hat, warum ein SVERWEIS zwei offensichtlich gleiche Namen nicht findet, kennt den Grund jetzt.
Jede Option ist eine einzelne Änderung. Nichts wird stillschweigend zusätzlich gemacht.
Nimm „Umbrüche zusammenführen". Einzelne Umbrüche verschwinden, Leerzeilen bleiben als Absatzgrenze erhalten.
Fast immer ein unsichtbares Zeichen oder ein zerlegter Umlaut. Schalt „Unsichtbare Zeichen entfernen" und „Unicode normalisieren" zu.
Nein. Nur die breitenlosen Verbinder darin können betroffen sein, was zusammengesetzte Emojis in ihre Einzelteile zerlegt.
Möglich. „Leerzeichen zusammenfassen" zerstört Einrückungen in Python und YAML. Für Code nur die Optionen nehmen, die du wirklich brauchst.
Genau dafür ist es da. Umbrüche zusammenführen und Leerzeichen zusammenfassen lösen den Großteil des Problems, inklusive Silbentrennung.
Nein. Du fügst Text ein und kopierst Text heraus. Es wird keine Datei gelesen oder geschrieben.
Nein. Alle Korrekturen laufen in diesem Tab auf deinem Gerät.