शब्द आवृत्ति विश्लेषक
टेक्स्टटेक्स्ट में शब्द और कैरेक्टर n-gram की आवृत्ति गिनें — CJK के लिए Intl.Segmenter, लैटिन शब्दों के लिए यूनिकोड अक्षर या रिक्ति — Top-N तालिका, हिस्सेदारी और CSV निर्यात के साथ।
दूरस्थ URL लाए नहीं जाते; अपना JSON सीधे पेस्ट करें।
इस पृष्ठ पर
शब्द आवृत्ति विश्लेषक क्या है?#
एक शब्द आवृत्ति विश्लेषक पाठ के किसी भाग को पढ़ता है और गिनता है कि प्रत्येक टोकन कितनी बार दिखता है, फिर उन्हें क्रम देता है। यह SEO के लिए कीवर्ड घनत्व जाँच, खोज अनुक्रमणिकाओं के लिए stopword खोज, भाषा सीखने के लिए शब्दावली-आकार अनुमान, और किसी भी गंभीर टेक्स्ट एडिटर में “सबसे सामान्य शब्द” पैनल के पीछे का टूल है। हाथ से शब्द गिनें और आप गलत होंगे; जैसे ही केस, विराम चिह्न और CJK विभाजन चित्र में आते हैं, सहज ज्ञान विफल हो जाता है।
कठिन हिस्सा यह तय करना है कि टोकन क्या माना जाए। यह टूल चार टोकनीकरण मोड देता है, क्योंकि सही उत्तर पाठ पर निर्भर करता है:
- रिक्ति विभाजन — किसी भी रिक्ति पर विभाजन। भाषा-अज्ञेयवादी;
Hello,औरhelloको कॉमा और कैपिटल के कारण भिन्न टोकन मानता है। - शब्द (अक्षर) — Unicode अक्षरों के अधिकतम रन (
\p{L}+)। अंक और विराम चिह्न हटाता है, इसलिएHello,,Helloबनता है। लातीनी-लिपि गद्य के लिए सही डिफ़ॉल्ट। - CJK (Intl.Segmenter) — चीनी/जापानी पाठ के उचित भाषाई विभाजन के लिए ब्राउज़र के
Intl.Segmenterको शब्द दानेदारी पर उपयोग करता है (我爱北京वास्तविक शब्द सीमाओं पर विभाजित होता है, प्रति-अक्षर नहीं)। जब ब्राउज़र में segmenter नहीं होता, तो यह प्रति-Han-अक्षर गिनती पर फ़ॉलबैक करता है और आपको चेतावनी देता है। - कैरेक्टर n-gram — रिक्ति-संक्षिप्त स्ट्रीम पर आकार 2–5 के अक्षर n-gram, पुनरावृत्ति-पैटर्न और टाइपो-क्लस्टर विश्लेषण के लिए।
सभी गिनती स्थानीय रूप से चलती है; एक मेगाबाइट से ऊपर के इनपुट के लिए यह एक बैकग्राउंड वर्कर पर चला जाता है ताकि पेज उत्तरदायी रहे।
इसका उपयोग कैसे करें#
- टूलबार में मोड चुनें: रिक्ति विभाजन, शब्द (अक्षर), CJK, या कैरेक्टर n-gram।
- Top-N सेट करें (डिफ़ॉल्ट 20, अधिकतम 1000)। केवल उतनी क्रमित पंक्तियाँ दिखाई जाती हैं, किंतु तालिका के नीचे कुल हमेशा हर टोकन को दर्शाते हैं।
- यदि आपने कैरेक्टर n-gram चुना, तो एक n-gram आकार चयनक (2, 3, 4 या 5) प्रकट होता है — ग्राम लंबाई चुनें।
- केस असंवेदनशील चुनें या अचुनें (डिफ़ॉल्ट चालू)। चालू होने पर,
Theऔरtheएक गिनती में मिलते हैं। - बाएँ फलक में अपना पाठ चिपकाएँ, या अंतर्निहित गद्य के लिए नमूना दबाएँ।
- दायाँ फलक पढ़ें: एक सारांश (कुल टोकन, अद्वितीय टोकन) और टोकन / गिनती / हिस्सा की क्रमित तालिका। तालिका के लिए कॉपी या किसी भी स्प्रेडशीट में खोलने योग्य
token,count,shareफ़ाइल के लिए CSV डाउनलोड करें का उपयोग करें।
यदि CJK मोड को इसलिए फ़ॉलबैक करना पड़ा क्योंकि आपके ब्राउज़र में Intl.Segmenter नहीं है, तो तालिका के नीचे एक छोटा नोट दिखता है ताकि आप जानें कि विभाजन प्रति-अक्षर है, भाषाई नहीं।
मुख्य विशेषताएँ#
- चार टोकनीकरण मोड। कच्ची गिनती के लिए रिक्ति, साफ़ शब्द गिनती के लिए शब्द, उचित चीनी/जापानी विभाजन के लिए CJK, पैटर्न खोज के लिए कैरेक्टर n-gram — बजाय एक मोड के जो चार में से तीन पाठों के लिए गलत हो।
- वास्तविक CJK विभाजन।
granularity: "word"के साथIntl.Segmenterउपयोग करता है, ब्राउज़र का अंतर्निहित भाषाई segmenter, इसलिए我爱北京天安门शब्द सीमाओं पर विभाजित होता है, अक्षर-दर-अक्षर हैक नहीं। - ईमानदार फ़ॉलबैक। जब segmenter अनुपलब्ध है, टूल प्रति-Han-अक्षर गिनती पर घटता है और आपको बताता है कि इसने ऐसा किया, बजाय चुपचाप भिन्न संख्याएँ उत्पन्न करने के।
- हिस्सा, केवल गिनती नहीं। हर पंक्ति सभी टोकन का अपना प्रतिशत दिखाती है, पूर्ण पाठ पर गणना — ताकि 10,000-शब्द दस्तावेज़ का एक Top-20 स्लाइस भी सार्थक प्रतिशत रिपोर्ट करे।
- CSV निर्यात। एक क्लिक में
token,count,shareफ़ाइल डाउनलोड, स्प्रेडशीट या चार्ट के लिए तैयार। - निर्धारक क्रम। tie वर्णानुक्रम (टोकन आरोही) से तोड़े जाते हैं, इसलिए समान इनपुट पर पुनः चलाना ब्राउज़रों और इंजनों में समान आउटपुट देता है।
- भारी-इनपुट वर्कर। ~1 MB से ऊपर के इनपुट बैकग्राउंड वर्कर पर जाते हैं, ताकि मुख्य थ्रेड और पेज का बाकी उत्तरदायी रहे।
- स्थानीय और सुरक्षित। टोकन केवल
textContentद्वारा रेंडर होते हैं — उपयोगकर्ता-नियंत्रित पाठ कभी तालिका कक्ष से बाहर नहीं तोड़ सकता।
विस्तृत उदाहरण#
इस छोटी पंक्ति को इनपुट में चिपकाएँ, मोड = रिक्ति विभाजन और केस असंवेदनशील चालू के साथ:
the quick brown fox the fox
सारांश 6 कुल टोकन और 4 अद्वितीय रिपोर्ट करता है। क्रमित तालिका है:
| टोकन | गिनती | हिस्सा |
|---|---|---|
| fox | 2 | 33.33% |
| the | 2 | 33.33% |
| brown | 1 | 16.67% |
| quick | 1 | 16.67% |
दो बातें ध्यान दें। पहला, fox, the से ऊपर क्रमित है यद्यपि गिनती समान है, क्योंकि tie वर्णानुक्रम तोड़ता है। दूसरा, हिस्से सभी चार टोकनों में 100% तक जोड़ते हैं — प्रतिशत पूर्ण टोकन कुल पर गणना होते हैं, केवल दिखाई पंक्तियों पर नहीं, इसलिए वे सार्थक रहते हैं तब भी जब Top N लंबी पूँछ को छिपाता है।
अब उसी पाठ पर मोड को आकार 2 के साथ कैरेक्टर n-gram पर स्विच करें (रिक्ति संक्षिप्त): विश्लेषक th, he, e , q … जैसे bigrams उत्पन्न करता है, जिससे आप देख सकें कौन-से अक्षर युग्म दोहराते हैं — जो तरीका है दोहराए उपसर्गों या फँसे हुए कीबोर्ड का शिकार करने का।
अक्सर पूछे जाने वाले प्रश्न#
सामान्य अंग्रेज़ी पाठ के लिए मुझे कौन-सा मोड उपयोग करना चाहिए?#
शब्द (अक्षर) लातीनी-लिपि गद्य के लिए सही डिफ़ॉल्ट है: यह विराम चिह्न और अंक हटाता है, इसलिए word, word. और word सभी एक ही टोकन माने जाते हैं, और आपको साफ़ शब्दावली गिनती मिलती है। रिक्ति विभाजन का उपयोग केवल तब करें जब विराम चिह्न स्वयं सार्थक हो (उदाहरण के लिए, किसी लॉग में कच्चे रिक्ति-सीमांकित फ़ील्ड गिनना)।
CJK मोड वास्तव में चीनी कैसे विभाजित करता है?#
यह ब्राउज़र के Intl.Segmenter को granularity: "word" के साथ कॉल करता है, जो एक वास्तविक भाषाई segmenter है जो जानता है कि चीनी शब्द कहाँ शुरू और समाप्त होते हैं। इसलिए 我爱北京天安门 पाँच अलग-अलग अक्षरों के बजाय वास्तविक शब्दों में विभाजित होता है। यदि आपका ब्राउज़र Intl.Segmenter का समर्थन नहीं करता, तो टूल प्रति-अक्षर गिनती पर फ़ॉलबैक करता है और एक नोट दिखाता है — संख्याएँ अभी भी घनत्व तुलना के लिए उपयोगी हैं, बस कम भाषाई रूप से सटीक।
कैरेक्टर n-gram मोड किसके लिए है?#
n-gram दोहराए उपस्ट्रिंग प्रकट करते हैं। लंबे पाठ पर 2-gram पास दिखाता है कि कौन-से अक्षर या अक्षर युग्म हावी हैं; 3-gram या 4-gram पास दोहराए उपसर्ग, सामान्य morpheme, या टाइपो क्लस्टर सामने लाता है। यह कीवर्ड-स्टफ़िंग ऑडिट, साइफर विश्लेषण और ऑटोकम्प्लीट क्रमांकन के पीछे की मानक तकनीक है।
मेरे प्रतिशत केवल दिखाए गए Top N पर नहीं, सभी टोकन पर आधारित क्यों हैं?#
क्योंकि प्रतिशत केवल वास्तविक कुल के विरुद्ध सार्थक है। यदि आप 5,000-शब्द निबंध में Top 10 शब्द माँगते हैं, तो प्रत्येक शब्द के हिस्से को पूरे निबंध का उसका स्लाइस दर्शाना चाहिए, न कि दिखाए गए 10 शब्दों का। पूर्ण टोकन कुल पर अनुपात गणना करना संख्याओं को ईमानदार रखता है तब भी जब तालिका छोटी की जाए।
क्या मेरा पाठ कहीं अपलोड होता है?#
नहीं। टोकनीकरण, गिनती और CSV निर्माण सब आपके ब्राउज़र में चलते हैं। बड़े इनपुट बैकग्राउंड वर्कर थ्रेड पर जाते हैं, किंतु वह थ्रेड अभी भी इसी पेज का हिस्सा है — कुछ भी सर्वर पर नहीं भेजा जाता।