Analyseur de fréquence des mots
TexteComptez la fréquence des mots et des n-grammes de caractères — CJK via Intl.Segmenter, mots latins via les lettres Unicode, ou espaces — avec un tableau Top-N, la part et l'export CSV.
Les URL distantes ne sont pas récupérées ; collez votre JSON directement.
Sur cette page
Qu’est-ce qu’un analyseur de fréquence de mots ?#
Un analyseur de fréquence de mots lit un corps de texte et compte le nombre d’apparitions de chaque token, puis les classe. C’est l’outil derrière la vérification de la densité de mots-clés pour le SEO, la découverte de mots-outils pour les index de recherche, l’estimation de la taille du vocabulaire pour l’apprentissage des langues, et le panneau « mots les plus fréquents » de tout éditeur de texte sérieux. Comptez les mots à la main et vous vous tromperez ; dès que la casse, la ponctuation et la segmentation CJK entrent en jeu, l’intuition échoue.
Le difficile, c’est de décider ce qui compte comme un token. Cet outil propose quatre modes de tokenisation, car la bonne réponse dépend du texte :
- Espace — découpe sur tout blanc. Insensible à la langue ; traite
Hello,ethellocomme des tokens différents à cause de la virgule et de la majuscule. - Regex — suites maximales de lettres Unicode (
\p{L}+). Supprime chiffres et ponctuation, doncHello,devientHello. Le bon défaut pour la prose en écriture latine. - CJK — utilise l’
Intl.Segmenterdu navigateur à la granularité mot pour une véritable segmentation linguistique du texte chinois/japonais (我爱北京se découpe sur les vraies frontières de mots, et non par caractère). Quand le navigateur manque du segmenteur, l’outil retombe sur un comptage par caractère Han et vous avertit. - N-gramme — n-grammes de caractères de taille 2–5 sur le flux à blancs réduits, pour l’analyse de motifs répétés et de foyers de coquilles.
Tout le comptage s’exécute localement ; pour les entrées au-dessus d’un mégaoctet, il bascule sur un worker en arrière-plan afin que la page reste réactive.
Comment l’utiliser#
- Choisissez le mode dans la barre d’outils : Espace, Regex, CJK ou N-gramme.
- Réglez Top N (par défaut 20, max 1000). Seules les premières lignes classées sont affichées, mais les totaux sous le tableau reflètent toujours tous les tokens.
- Si vous avez choisi N-gramme, un sélecteur de taille (2, 3, 4 ou 5) apparaît — choisissez la longueur du gramme.
- Cochez ou décochez Insensible à la casse (activé par défaut). Quand l’option est activée,
Theetthefusionnent en un seul compte. - Collez votre texte dans le panneau de gauche, ou cliquez sur Exemple pour un passage intégré.
- Lisez le panneau de droite : un résumé (tokens totaux, tokens uniques) et un tableau classé de token / compte / part. Utilisez Copier pour le tableau ou Télécharger CSV pour un fichier
token,count,shareouvrable dans tout tableur.
Si le mode CJK a dû retomber parce que votre navigateur manque d’Intl.Segmenter, une petite note apparaît sous le tableau, pour que vous sachiez que la segmentation est par caractère plutôt que linguistique.
Fonctionnalités clés#
- Quatre modes de tokenisation. Espace pour les comptes bruts, Regex pour des comptes de mots propres, CJK pour une véritable segmentation chinois/japonais, N-gramme pour la découverte de motifs — au lieu d’un seul mode qui se trompe pour trois textes sur quatre.
- Véritable segmentation CJK. Utilise
Intl.Segmenteravecgranularity: "word", le segmenteur linguistique intégré au navigateur, si bien que我爱北京天安门est découpé sur les frontières de mots, et non haché caractère par caractère. - Repli honnête. Quand le segmenteur n’est pas disponible, l’outil dégénère en comptage par caractère Han et vous le dit, plutôt que de produire silencieusement des chiffres différents.
- Part, pas seulement compte. Chaque ligne affiche son pourcentage sur tous les tokens, calculé sur le texte entier — donc même une tranche Top-20 d’un document de 10 000 mots rapporte des pourcentages significatifs.
- Export CSV. Un clic télécharge un fichier
token,count,share, prêt pour un tableur ou un graphique. - Ordre déterministe. Les égalités sont départagées alphabétiquement (token ascendant), donc une ré-exécution sur entrée identique donne une sortie identique à travers navigateurs et moteurs.
- Worker pour les entrées lourdes. Les entrées au-dessus d’environ 1 Mo basculent sur un worker en arrière-plan, afin que le fil principal et le reste de la page restent réactifs.
- Local et sûr. Les tokens ne sont rendus qu’avec
textContent— un texte contrôlé par l’utilisateur ne peut jamais s’échapper d’une cellule de tableau.
Exemple commenté#
Collez cette courte ligne dans l’entrée, avec mode = Espace et Insensible à la casse activé :
the quick brown fox the fox
Le résumé rapporte 6 tokens totaux et 4 uniques. Le tableau classé est :
| Token | Nombre | Part |
|---|---|---|
| fox | 2 | 33.33 % |
| the | 2 | 33.33 % |
| brown | 1 | 16.67 % |
| quick | 1 | 16.67 % |
Deux choses à remarquer. D’abord, fox classe au-dessus de the malgré le même compte, parce que les égalités se départagent alphabétiquement. Ensuite, les parts s’additionnent à 100 % sur les quatre tokens — les pourcentages sont calculés sur le total complet des tokens, et non seulement sur les lignes affichées, donc ils restent significatifs même quand Top N masque la longue traîne.
Basculez maintenant le mode sur N-gramme avec taille 2 sur le même texte (blancs réduits) : l’analyseur produit des bigrammes comme th, he, e , q… vous laissant voir quelles paires de lettres se répètent — la façon dont vous traqueriez des préfixes dupliqués ou un clavier bloqué.
FAQ#
Quel mode utiliser pour du texte anglais normal ?#
Regex est le bon défaut pour la prose en écriture latine : il supprime ponctuation et chiffres, donc word, word. et word comptent tous comme le même token, et vous obtenez un compte de vocabulaire propre. N’utilisez Espace que quand la ponctuation elle-même est significative (par exemple, compter des champs bruts séparés par des blancs dans un journal).
Comment le mode CJK découpe-t-il réellement le chinois ?#
Il appelle l’Intl.Segmenter du navigateur avec granularity: "word", qui est un véritable segmenteur linguistique sachant où les mots chinois commencent et finissent. Donc 我爱北京天安门 se découpe en mots réels plutôt qu’en cinq caractères séparés. Si votre navigateur ne gère pas Intl.Segmenter, l’outil retombe sur un comptage par caractère et affiche une note — les chiffres restent utilisables pour la comparaison de densité, simplement moins précis linguistiquement.
À quoi sert le mode n-gramme ?#
Les n-grammes révèlent les sous-chaînes répétées. Une passe en 2-grammes sur un long texte montre quelles paires de lettres ou de caractères dominent ; une passe en 3-grammes ou 4-grammes fait émerger des préfixes répétés, des morphèmes courants ou des foyers de coquilles. C’est la technique standard derrière les audits de bourrage de mots-clés, l’analyse de chiffrements et le classement d’auto-complétion.
Pourquoi mes pourcentages sont-ils fondés sur tous les tokens, et non seulement sur le Top N affiché ?#
Parce qu’un pourcentage n’a de sens que rapporté au total réel. Si vous demandez les 10 premiers mots d’un essai de 5 000 mots, la part de chaque mot devrait refléter sa tranche de l’essai entier, et non sa tranche des 10 mots affichés. Calculer le ratio sur le total complet des tokens garde les chiffres honnêtes même quand le tableau est tronqué.
Mon texte est-il téléversé quelque part ?#
Non. La tokenisation, le comptage et la génération CSV s’exécutent tous dans votre navigateur. Les grosses entrées basculent sur un fil de worker en arrière-plan, mais ce fil fait encore partie de cette page — rien n’est envoyé vers un serveur.