टूल
गाइड

शब्द आवृत्ति विश्लेषक

टेक्स्ट

टेक्स्ट में शब्द और कैरेक्टर n-gram की आवृत्ति गिनें — CJK के लिए Intl.Segmenter, लैटिन शब्दों के लिए यूनिकोड अक्षर या रिक्ति — Top-N तालिका, हिस्सेदारी और CSV निर्यात के साथ।

100% क्लाइंट-साइड कोई बैकएंड नहीं

दूरस्थ URL लाए नहीं जाते; अपना JSON सीधे पेस्ट करें।

इनपुट
आउटपुट
शब्द आवृत्ति विश्लेषण के लिए टेक्स्ट दर्ज करें।
इस पृष्ठ पर

शब्द आवृत्ति विश्लेषक क्या है?#

एक शब्द आवृत्ति विश्लेषक पाठ के किसी भाग को पढ़ता है और गिनता है कि प्रत्येक टोकन कितनी बार दिखता है, फिर उन्हें क्रम देता है। यह SEO के लिए कीवर्ड घनत्व जाँच, खोज अनुक्रमणिकाओं के लिए stopword खोज, भाषा सीखने के लिए शब्दावली-आकार अनुमान, और किसी भी गंभीर टेक्स्ट एडिटर में “सबसे सामान्य शब्द” पैनल के पीछे का टूल है। हाथ से शब्द गिनें और आप गलत होंगे; जैसे ही केस, विराम चिह्न और CJK विभाजन चित्र में आते हैं, सहज ज्ञान विफल हो जाता है।

कठिन हिस्सा यह तय करना है कि टोकन क्या माना जाए। यह टूल चार टोकनीकरण मोड देता है, क्योंकि सही उत्तर पाठ पर निर्भर करता है:

  • रिक्ति विभाजन — किसी भी रिक्ति पर विभाजन। भाषा-अज्ञेयवादी; Hello, और hello को कॉमा और कैपिटल के कारण भिन्न टोकन मानता है।
  • शब्द (अक्षर) — Unicode अक्षरों के अधिकतम रन (\p{L}+)। अंक और विराम चिह्न हटाता है, इसलिए Hello,, Hello बनता है। लातीनी-लिपि गद्य के लिए सही डिफ़ॉल्ट।
  • CJK (Intl.Segmenter) — चीनी/जापानी पाठ के उचित भाषाई विभाजन के लिए ब्राउज़र के Intl.Segmenter को शब्द दानेदारी पर उपयोग करता है (我爱北京 वास्तविक शब्द सीमाओं पर विभाजित होता है, प्रति-अक्षर नहीं)। जब ब्राउज़र में segmenter नहीं होता, तो यह प्रति-Han-अक्षर गिनती पर फ़ॉलबैक करता है और आपको चेतावनी देता है।
  • कैरेक्टर n-gram — रिक्ति-संक्षिप्त स्ट्रीम पर आकार 2–5 के अक्षर n-gram, पुनरावृत्ति-पैटर्न और टाइपो-क्लस्टर विश्लेषण के लिए।

सभी गिनती स्थानीय रूप से चलती है; एक मेगाबाइट से ऊपर के इनपुट के लिए यह एक बैकग्राउंड वर्कर पर चला जाता है ताकि पेज उत्तरदायी रहे।

इसका उपयोग कैसे करें#

  1. टूलबार में मोड चुनें: रिक्ति विभाजन, शब्द (अक्षर), CJK, या कैरेक्टर n-gram।
  2. Top-N सेट करें (डिफ़ॉल्ट 20, अधिकतम 1000)। केवल उतनी क्रमित पंक्तियाँ दिखाई जाती हैं, किंतु तालिका के नीचे कुल हमेशा हर टोकन को दर्शाते हैं।
  3. यदि आपने कैरेक्टर n-gram चुना, तो एक n-gram आकार चयनक (2, 3, 4 या 5) प्रकट होता है — ग्राम लंबाई चुनें।
  4. केस असंवेदनशील चुनें या अचुनें (डिफ़ॉल्ट चालू)। चालू होने पर, The और the एक गिनती में मिलते हैं।
  5. बाएँ फलक में अपना पाठ चिपकाएँ, या अंतर्निहित गद्य के लिए नमूना दबाएँ।
  6. दायाँ फलक पढ़ें: एक सारांश (कुल टोकन, अद्वितीय टोकन) और टोकन / गिनती / हिस्सा की क्रमित तालिका। तालिका के लिए कॉपी या किसी भी स्प्रेडशीट में खोलने योग्य token,count,share फ़ाइल के लिए CSV डाउनलोड करें का उपयोग करें।

यदि CJK मोड को इसलिए फ़ॉलबैक करना पड़ा क्योंकि आपके ब्राउज़र में Intl.Segmenter नहीं है, तो तालिका के नीचे एक छोटा नोट दिखता है ताकि आप जानें कि विभाजन प्रति-अक्षर है, भाषाई नहीं।

मुख्य विशेषताएँ#

  • चार टोकनीकरण मोड। कच्ची गिनती के लिए रिक्ति, साफ़ शब्द गिनती के लिए शब्द, उचित चीनी/जापानी विभाजन के लिए CJK, पैटर्न खोज के लिए कैरेक्टर n-gram — बजाय एक मोड के जो चार में से तीन पाठों के लिए गलत हो।
  • वास्तविक CJK विभाजन। granularity: "word" के साथ Intl.Segmenter उपयोग करता है, ब्राउज़र का अंतर्निहित भाषाई segmenter, इसलिए 我爱北京天安门 शब्द सीमाओं पर विभाजित होता है, अक्षर-दर-अक्षर हैक नहीं।
  • ईमानदार फ़ॉलबैक। जब segmenter अनुपलब्ध है, टूल प्रति-Han-अक्षर गिनती पर घटता है और आपको बताता है कि इसने ऐसा किया, बजाय चुपचाप भिन्न संख्याएँ उत्पन्न करने के।
  • हिस्सा, केवल गिनती नहीं। हर पंक्ति सभी टोकन का अपना प्रतिशत दिखाती है, पूर्ण पाठ पर गणना — ताकि 10,000-शब्द दस्तावेज़ का एक Top-20 स्लाइस भी सार्थक प्रतिशत रिपोर्ट करे।
  • CSV निर्यात। एक क्लिक में token,count,share फ़ाइल डाउनलोड, स्प्रेडशीट या चार्ट के लिए तैयार।
  • निर्धारक क्रम। tie वर्णानुक्रम (टोकन आरोही) से तोड़े जाते हैं, इसलिए समान इनपुट पर पुनः चलाना ब्राउज़रों और इंजनों में समान आउटपुट देता है।
  • भारी-इनपुट वर्कर। ~1 MB से ऊपर के इनपुट बैकग्राउंड वर्कर पर जाते हैं, ताकि मुख्य थ्रेड और पेज का बाकी उत्तरदायी रहे।
  • स्थानीय और सुरक्षित। टोकन केवल textContent द्वारा रेंडर होते हैं — उपयोगकर्ता-नियंत्रित पाठ कभी तालिका कक्ष से बाहर नहीं तोड़ सकता।

विस्तृत उदाहरण#

इस छोटी पंक्ति को इनपुट में चिपकाएँ, मोड = रिक्ति विभाजन और केस असंवेदनशील चालू के साथ:

the quick brown fox the fox

सारांश 6 कुल टोकन और 4 अद्वितीय रिपोर्ट करता है। क्रमित तालिका है:

टोकनगिनतीहिस्सा
fox233.33%
the233.33%
brown116.67%
quick116.67%

दो बातें ध्यान दें। पहला, fox, the से ऊपर क्रमित है यद्यपि गिनती समान है, क्योंकि tie वर्णानुक्रम तोड़ता है। दूसरा, हिस्से सभी चार टोकनों में 100% तक जोड़ते हैं — प्रतिशत पूर्ण टोकन कुल पर गणना होते हैं, केवल दिखाई पंक्तियों पर नहीं, इसलिए वे सार्थक रहते हैं तब भी जब Top N लंबी पूँछ को छिपाता है।

अब उसी पाठ पर मोड को आकार 2 के साथ कैरेक्टर n-gram पर स्विच करें (रिक्ति संक्षिप्त): विश्लेषक th, he, e , q … जैसे bigrams उत्पन्न करता है, जिससे आप देख सकें कौन-से अक्षर युग्म दोहराते हैं — जो तरीका है दोहराए उपसर्गों या फँसे हुए कीबोर्ड का शिकार करने का।

अक्सर पूछे जाने वाले प्रश्न#

सामान्य अंग्रेज़ी पाठ के लिए मुझे कौन-सा मोड उपयोग करना चाहिए?#

शब्द (अक्षर) लातीनी-लिपि गद्य के लिए सही डिफ़ॉल्ट है: यह विराम चिह्न और अंक हटाता है, इसलिए word, word. और word सभी एक ही टोकन माने जाते हैं, और आपको साफ़ शब्दावली गिनती मिलती है। रिक्ति विभाजन का उपयोग केवल तब करें जब विराम चिह्न स्वयं सार्थक हो (उदाहरण के लिए, किसी लॉग में कच्चे रिक्ति-सीमांकित फ़ील्ड गिनना)।

CJK मोड वास्तव में चीनी कैसे विभाजित करता है?#

यह ब्राउज़र के Intl.Segmenter को granularity: "word" के साथ कॉल करता है, जो एक वास्तविक भाषाई segmenter है जो जानता है कि चीनी शब्द कहाँ शुरू और समाप्त होते हैं। इसलिए 我爱北京天安门 पाँच अलग-अलग अक्षरों के बजाय वास्तविक शब्दों में विभाजित होता है। यदि आपका ब्राउज़र Intl.Segmenter का समर्थन नहीं करता, तो टूल प्रति-अक्षर गिनती पर फ़ॉलबैक करता है और एक नोट दिखाता है — संख्याएँ अभी भी घनत्व तुलना के लिए उपयोगी हैं, बस कम भाषाई रूप से सटीक।

कैरेक्टर n-gram मोड किसके लिए है?#

n-gram दोहराए उपस्ट्रिंग प्रकट करते हैं। लंबे पाठ पर 2-gram पास दिखाता है कि कौन-से अक्षर या अक्षर युग्म हावी हैं; 3-gram या 4-gram पास दोहराए उपसर्ग, सामान्य morpheme, या टाइपो क्लस्टर सामने लाता है। यह कीवर्ड-स्टफ़िंग ऑडिट, साइफर विश्लेषण और ऑटोकम्प्लीट क्रमांकन के पीछे की मानक तकनीक है।

मेरे प्रतिशत केवल दिखाए गए Top N पर नहीं, सभी टोकन पर आधारित क्यों हैं?#

क्योंकि प्रतिशत केवल वास्तविक कुल के विरुद्ध सार्थक है। यदि आप 5,000-शब्द निबंध में Top 10 शब्द माँगते हैं, तो प्रत्येक शब्द के हिस्से को पूरे निबंध का उसका स्लाइस दर्शाना चाहिए, न कि दिखाए गए 10 शब्दों का। पूर्ण टोकन कुल पर अनुपात गणना करना संख्याओं को ईमानदार रखता है तब भी जब तालिका छोटी की जाए।

क्या मेरा पाठ कहीं अपलोड होता है?#

नहीं। टोकनीकरण, गिनती और CSV निर्माण सब आपके ब्राउज़र में चलते हैं। बड़े इनपुट बैकग्राउंड वर्कर थ्रेड पर जाते हैं, किंतु वह थ्रेड अभी भी इसी पेज का हिस्सा है — कुछ भी सर्वर पर नहीं भेजा जाता।