Wörter- und Zeichenzähler
Wörter, Zeichen, Sätze und Lesezeit — live beim Tippen.
Text
Wiederholte Zeilen löschen, sortieren und Häufigkeiten zählen.
Standardmäßig gilt eine Zeile als Dublette, wenn sie zeichengenau identisch ist. Zwei Optionen ändern das, und beide sind bei deutschen Listen wichtig.
Leerraum beschneiden entfernt Leerzeichen am Zeilenanfang und -ende. Aus einer aus Excel kopierten Liste kommen regelmäßig Zeilen mit unsichtbaren Leerzeichen — ohne diese Option bleiben sie als vermeintlich verschiedene Einträge stehen.
Schreibung ignorieren behandelt „Müller" und „müller" als dieselbe Zeile. Bei Namenslisten meist erwünscht, bei Kennungen und Passwörtern nie.
Ein deutscher Sonderfall bleibt: „Müller" mit vorkomponiertem ü und „Müller" mit zerlegtem ü sehen identisch aus und gelten hier als verschieden. Wenn eine Liste aus gemischten Quellen stammt — besonders wenn macOS beteiligt war — lohnt vorher der Durchgang durch unseren Text-Reiniger mit Unicode-Normalisierung.
Die Vorgabe behält das erste und verwirft alle weiteren. Das ist fast immer richtig, weil die ursprüngliche Reihenfolge erhalten bleibt.
Es gibt einen Fall, in dem das letzte besser ist: wenn die Liste chronologisch geführt wird und spätere Einträge frühere ersetzen. Ein Protokoll, in dem jede Zeile den aktuellen Stand eines Datensatzes enthält, braucht den letzten.
Wo die Reihenfolge egal ist, ist Sortieren die klarere Wahl: Dann liegen gleiche Einträge ohnehin beieinander und das Ergebnis ist reproduzierbar.
Beim Sortieren deutscher Texte ist die Reihenfolge übrigens nicht selbstverständlich: Nach DIN 5007-1 wird „ä" wie „a" einsortiert, nach DIN 5007-2 — der Namenssortierung, etwa im Telefonbuch — wie „ae". „Müller" steht danach mal vor und mal nach „Mueller".
Statt Dubletten zu entfernen, lässt sich auch zählen, wie oft jede Zeile vorkommt. Das ist oft die nützlichere Auswertung.
Typische Anwendungen: Welche Suchbegriffe kommen in einem Protokoll am häufigsten vor? Welche Fehlermeldung tritt am öftesten auf? Welche Adresse steht mehrfach in einer Einladungsliste?
Die Ausgabe ist nach Häufigkeit sortiert und lässt sich als zweispaltige Liste kopieren — direkt weiterverwendbar in einer Tabellenkalkulation.
Zur Größe: Einige Hunderttausend Zeilen sind unproblematisch, weil die Erkennung über eine Hash-Struktur läuft und nicht jede Zeile mit jeder vergleicht. Die Grenze setzt der Arbeitsspeicher, nicht die Rechenzeit.
Listen, die bereinigt werden müssen, enthalten fast immer personenbezogene Daten.
E-Mail-Verteiler, Teilnehmerlisten, Kundennummern, Adressdatenbestände — das ist der Regelfall, nicht die Ausnahme. Eine solche Liste in ein beliebiges Online-Werkzeug einzufügen, ist eine Übermittlung an einen Dritten, für die es meist weder Rechtsgrundlage noch Auftragsverarbeitungsvertrag gibt.
Dieses Werkzeug arbeitet ausschließlich in deinem Browser. Prüfbar ist das im Netzwerk-Tab: Beim Einfügen und Verarbeiten erscheint keine Anfrage. Du kannst die Verbindung trennen und weiterarbeiten.
Ja, sofern du nicht sortierst. Standardmäßig wird das erste Vorkommen behalten.
Standardmäßig ja. Es gibt eine Option, sie zu ignorieren — bei Namen sinnvoll, bei Kennungen nicht.
Meist unsichtbare Leerzeichen oder zerlegte Umlaute. Nimm die Option zum Beschneiden oder vorher den Text-Reiniger.
Einige Hunderttausend. Die Erkennung läuft über eine Hash-Struktur, nicht über paarweise Vergleiche.
Ja. Die Häufigkeitsansicht zeigt jede Zeile mit ihrer Anzahl, nach Häufigkeit sortiert.
Nein. Alles läuft in diesem Tab, prüfbar im Netzwerk-Tab.