Worthäufigkeits-Analyse
TextZählt Wort- und Zeichen-n-Gramm-Häufigkeiten — CJK über Intl.Segmenter, lateinische Wörter über Unicode-Buchstaben oder Leerzeichen — mit Top-N-Tabelle, Anteil und CSV-Export.
Remote-URLs werden nicht abgerufen; fügen Sie Ihr JSON direkt ein.
Auf dieser Seite
Was ist ein Worthäufigkeits-Analysewerkzeug?#
Ein Worthäufigkeits-Analysewerkzeug liest einen Textkörper und zählt, wie oft jedes Token erscheint, und reiht sie dann. Es ist das Werkzeug hinter Keyword-Dichte-Checks für SEO, Stoppwort-Entdeckung für Suchindizes, Vokabular-Größenschätzungen für das Sprachenlernen und dem „häufigste Wörter“-Panel in jedem ernsthaften Texteditor. Zählen Sie Wörter von Hand, liegen Sie falsch; sobald Groß-/Kleinschreibung, Zeichensetzung und CJK-Segmentierung ins Spiel kommen, versagt die Intuition.
Das Schwierige ist zu entscheiden, was als Token zählt. Dieses Werkzeug bietet vier Tokenisierungs-Modi, weil die richtige Antwort vom Text abhängt:
- Leerzeichen-Aufteilung — Aufteilung an jedem Whitespace. Sprachagnostisch; behandelt
Hello,undhellowegen des Kommas und des großen Anfangsbuchstabens als verschiedene Tokens. - Wörter (Buchstaben) — maximale Läufe von Unicode-Buchstaben (
\p{L}+). Lässt Ziffern und Zeichensetzung weg, sodassHello,zuHellowird. Die richtige Standardeinstellung für lateinische Prosa. - CJK (Intl.Segmenter) — nutzt den
Intl.Segmenterdes Browsers auf Wort-Granularität für echte linguistische Segmentierung chinesischer/japanischer Texte (我爱北京trennt an tatsächlichen Wortgrenzen, nicht pro Zeichen). Fehlt der Browser den Segmenter, fällt er auf Pro-Han-Zeichen-Zählung zurück und warnt Sie. - Zeichen-n-Gramm — Zeichen-n-Gramm der Größe 2–5 über dem whitespace-kollabierten Strom, für Wiederholungsmuster- und Tippfehler-Cluster-Analyse.
Die gesamte Zählung läuft lokal; für Eingaben jenseits eines Megabyte verlagert sie auf einen Hintergrund-Worker, damit die Seite ansprechend bleibt.
So wird es verwendet#
- Wählen Sie den Modus in der Werkzeugleiste: Leerzeichen-Aufteilung, Wörter (Buchstaben), CJK (Intl.Segmenter) oder Zeichen-n-Gramm.
- Stellen Sie Top-N ein (Standard 20, max 1000). Nur so viele gereihte Zeilen werden gezeigt, aber die Summen unter der Tabelle spiegeln immer jedes Token.
- Haben Sie Zeichen-n-Gramm gewählt, erscheint eine n-Gramm-Größe-Auswahl (2, 3, 4 oder 5) — wählen Sie die Gram-Länge.
- Aktivieren oder deaktivieren Sie Groß-/Kleinschreibung ignorieren (standardmäßig an). Wenn an, verschmelzen
Theundthezu einer Zählung. - Fügen Sie Ihren Text in die linke Spalte ein, oder klicken Sie auf Beispiel für eine eingebate Passage.
- Lesen Sie die rechte Spalte: eine Zusammenfassung (gesamte Tokens, eindeutige Tokens) und eine gereihte Tabelle von Token / Anzahl / Anteil. Nutzen Sie Kopieren für die Tabelle oder CSV herunterladen für eine
token,count,share-Datei, die Sie in jeder Tabellenkalkulation öffnen können.
Musste der CJK-Modus zurückfallen, weil Ihr Browser Intl.Segmenter fehlt, erscheint eine kleine Notiz unter der Tabelle, damit Sie wissen, dass die Segmentierung pro Zeichen statt linguistisch ist.
Die wichtigsten Funktionen#
- Vier Tokenisierungs-Modi. Leerzeichen für rohe Zählungen, Wörter für saubere Wortzählungen, CJK für echte chinesische/japanische Segmentierung, n-Gramm für Musterentdeckung — statt eines Modus, der für drei von vier Texten falsch liegt.
- Echte CJK-Segmentierung. Nutzt
Intl.Segmentermitgranularity: "word", den eingebauten linguistischen Segmenter des Browsers, sodass我爱北京天安门an Wortgrenzen getrennt wird, nicht Zeichen für Zeichen zerschlagen. - Ehrlicher Fallback. Wenn der Segmenter nicht verfügbar ist, degradiert das Werkzeug auf Pro-Han-Zeichen-Zählung und sagt Ihnen das, statt lautlos andere Zahlen zu produzieren.
- Anteil, nicht nur Zählung. Jede Zeile zeigt ihren Prozentsatz aller Tokens, berechnet über den gesamten Text — sodass selbst ein Top-20-Slice eines 10.000-Wort-Dokuments sinnvolle Prozentsätze liefert.
- CSV-Export. Ein Klick lädt eine
token,count,share-Datei herunter, bereit für eine Tabellenkalkulation oder ein Diagramm. - Deterministische Reihung. Gleichstände werden alphabetisch gebrochen (Token aufsteigend), sodass ein wiederholter Durchlauf mit identischer Eingabe über Browser und Engines hinweg identische Ausgabe liefert.
- Worker für schwere Eingaben. Eingaben über ~1 MB verlagern auf einen Hintergrund-Worker, sodass der Hauptthread und der Rest der Seite ansprechend bleiben.
- Lokal und sicher. Tokens werden nur mit
textContentgerendert — benutzergesteuerter Text kann nie aus einer Tabellenzelle ausbrechen.
Anwendungsbeispiel#
Fügen Sie diese kurze Zeile in die Eingabe ein, mit Modus = Leerzeichen-Aufteilung und Groß-/Kleinschreibung ignorieren an:
the quick brown fox the fox
Die Zusammenfassung meldet 6 gesamte Tokens und 4 eindeutige. Die gereihte Tabelle:
| Token | Anzahl | Anteil |
|---|---|---|
| fox | 2 | 33,33 % |
| the | 2 | 33,33 % |
| brown | 1 | 16,67 % |
| quick | 1 | 16,67 % |
Zwei Dinge fallen auf. Erstens rangt fox trotz gleicher Anzahl über the, weil Gleichstände alphabetisch gebrochen werden. Zweitens addieren sich die Anteile über alle vier Tokens zu 100 % — die Prozentsätze werden über die gesamte Token-Gesamtsumme berechnet, nicht nur über die gezeigten Zeilen, sodass sie sinnvoll bleiben, selbst wenn Top-N den langen Schwanz verbirgt.
Schalten Sie nun den Modus auf Zeichen-n-Gramm mit Größe 2 über demselben Text (Whitespace kollabiert): der Analysator erzeugt Bigramme wie th, he, e , q …, sodass Sie sehen, welche Buchstabenpaare sich wiederholen — so würde man duplizierte Präfixe oder eine klemmende Tastatur jagen.
FAQ#
Welchen Modus soll ich für normalen englischen Text verwenden?#
Wörter (Buchstaben) ist die richtige Standardeinstellung für lateinische Prosa: sie streift Zeichensetzung und Ziffern, sodass word, word. und word alle als dasselbe Token zählen, und Sie eine saubere Vokabularzählung erhalten. Nutzen Sie Leerzeichen-Aufteilung nur, wenn die Zeichensetzung selbst bedeutungstragend ist (z. B. beim Zählen roher leerzeichengtrennter Felder in einem Log).
Wie trennt der CJK-Modus tatsächlich Chinesisch?#
Er ruft den Intl.Segmenter des Browsers mit granularity: "word" auf, der ein echter linguistischer Segmenter ist, der weiß, wo chinesische Wörter beginnen und enden. Daher teilt 我爱北京天安门 in tatsächliche Wörter statt in fünf einzelne Zeichen. Unterstützt Ihr Browser Intl.Segmenter nicht, fällt das Werkzeug auf Pro-Zeichen-Zählung zurück und zeigt einen Hinweis — die Zahlen sind noch für Dichtevergleiche nutzbar, nur weniger linguistisch präzise.
Wofür ist der n-Gramm-Modus?#
n-Gramme offenbaren sich wiederholende Teilzeichenketten. Ein 2-Gramm-Durchlauf über einen langen Text zeigt, welche Buchstaben- oder Zeichenpaare dominieren; ein 3-Gramm- oder 4-Gramm-Durchlauf fördert wiederholte Präfixe, häufige Morpheme oder Tippfehler-Cluster. Es ist die Standardtechnik hinter Keyword-Stuffing-Audits, Chiffre-Analyse und Autocomplete-Ranking.
Warum basieren meine Prozentsätze auf allen Tokens, nicht nur auf den gezeigten Top-N?#
Weil ein Prozentsatz nur gegen die echte Summe sinnvoll ist. Wenn Sie nach den Top-10-Wörtern in einem 5.000-Wort-Aufsatz fragen, sollte der Anteil jedes Worts seinen Slice des ganzen Aufsatzes spiegeln, nicht seinen Slice der 10 gezeigten Wörter. Das Verhältnis über die gesamte Token-Gesamtsumme zu berechnen, hält die Zahlen ehrlich, auch wenn die Tabelle abgeschnitten ist.
Wird mein Text irgendwohin hochgeladen?#
Nein. Tokenisierung, Zählung und CSV-Erzeugung laufen alle in Ihrem Browser. Große Eingaben verlagern auf einen Hintergrund-Worker-Thread, aber dieser Thread ist immer noch Teil dieser Seite — nichts wird an einen Server gesendet.