শব্দ ফ্রিকোয়েন্সি বিশ্লেষক
টেক্সটটেক্সটে শব্দ এবং ক্যারেক্টার n-gram ফ্রিকোয়েন্সি গণনা করুন — CJK-র জন্য Intl.Segmenter, ল্যাটিন শব্দের জন্য ইউনিকোড অক্ষর বা স্পেস — Top-N টেবিল, অনুপাত এবং CSV রপ্তানি সহ।
দূরবর্তী URL আনা হয় না; আপনার JSON সরাসরি পেস্ট করুন।
এই পৃষ্ঠায়
শব্দ ফ্রিকোয়েন্সি বিশ্লেষক কী?#
একটি শব্দ ফ্রিকোয়েন্সি বিশ্লেষক একটি টেক্সট বডি পড়ে এবং প্রতিটি টোকেন কতবার দেখা যায় তা গণনা করে, তারপর সেগুলোকে সারিবদ্ধ করে। এটি SEO-এর জন্য কীওয়ার্ড ঘনত্ব চেক, অনুসন্ধান সূচকের জন্য stopword আবিষ্কার, ভাষা শেখার জন্য শব্দভাণ্ডার-আকার অনুমান, এবং যেকোনো গুরুতর টেক্সট এডিটরে “সবচেয়ে সাধারণ শব্দ” প্যানেলের পেছনের টুল। হাতে শব্দ গণনা করলে আপনি ভুল হবেন; কেস, যতিচিহ্ন এবং CJK সেগমেন্টেশন ছবিতে প্রবেশ করার সাথে সাথে অন্তর্দৃষ্টি ব্যর্থ হয়।
কঠিন অংশ হলো স্থির করা কী একটি টোকেন হিসেবে গণনা করে। এই টুল চারটি টোকেনাইজেশন মোড সরবরাহ করে, কারণ সঠিক উত্তর টেক্সটের উপর নির্ভর করে:
- স্পেসে বিভক্ত — যেকোনো সাদাসিধেতে বিভক্ত। ভাষা-অজ্ঞেয়;
Hello,এবংhello-কে আলাদা টোকেন হিসেবে বিবেচনা করে কারণ কমা এবং বড় হাতের কারণে। - শব্দ (অক্ষর) — Unicode অক্ষরের সর্বোচ্চ রান (
\p{L}+)। সংখ্যা এবং যতিচিহ্ন বাদ দেয়, তাইHello,হয়ে যায়Hello। লাতিন-স্ক্রিপ্ট গদ্যের জন্য সঠিক ডিফল্ট। - CJK — চাইনিজ/জাপানিজ টেক্সটের সঠিক ভাষাগত সেগমেন্টেশনের জন্য ব্রাউজারের
Intl.Segmenterব্যবহার করে শব্দ গ্রানুলারিটিতে (我爱北京প্রতি অক্ষরে নয়, প্রকৃত শব্দ সীমানায় বিভক্ত হয়)। ব্রাউজারে সেগমেন্টার না থাকলে, এটি প্রতি-হান-অক্ষরে গণনায় ফিরে যায় এবং আপনাকে সতর্ক করে। - ক্যারেক্টার n-gram — সাদাসিধে-সঙ্কুচিত স্ট্রিমের উপর ২–৫ আকারের অক্ষর n-গ্রাম, পুনরাবৃত্তি-প্যাটার্ন এবং টাইপো-ক্লাস্টার বিশ্লেষণের জন্য।
সমস্ত গণনা স্থানীয়ভাবে চলে; এক মেগাবাইটের উপরে ইনপুটের জন্য এটি একটি ব্যাকগ্রাউন্ড ওয়ার্কারে চলে যায় যাতে পৃষ্ঠাটি প্রতিক্রিয়াশীল থাকে।
কীভাবে ব্যবহার করবেন#
- টুলবারে মোড বাছুন: স্পেসে বিভক্ত, শব্দ (অক্ষর), CJK, বা ক্যারেক্টার n-gram।
- Top-N সেট করুন (ডিফল্ট ২০, সর্বোচ্চ ১০০০)। কেবল ততগুলো সারিবদ্ধ সারি দেখানো হয়, কিন্তু টেবিলের নিচের মোটগুলো সর্বদা প্রতিটি টোকেন প্রতিফলিত করে।
- আপনি যদি N-gram বাছেন, একটি আকার নির্বাচক (২, ৩, ৪ বা ৫) দেখা যায় — গ্রাম দৈর্ঘ্য বাছুন।
- কেস-সংবেদনশীল নয় টিক দিন বা তুলে দিন (ডিফল্ট চালু)। চালু থাকলে,
Theএবংtheএকটি গণনায় একত্রিত হয়। - আপনার টেক্সট বাম পেনে পেস্ট করুন, বা একটি বিল্ট-ইন প্যাসেজের জন্য নমুনা চাপুন।
- ডান পেন পড়ুন: একটি সারাংশ (মোট টোকেন, স্বতন্ত্র টোকেন) এবং টোকেন / গণনা / অনুপাতের একটি সারিবদ্ধ টেবিল। টেবিলের জন্য কপি বা যেকোনো স্প্রেডশিটে খোলার জন্য একটি
token,count,shareফাইলের জন্য CSV ডাউনলোড ব্যবহার করুন।
যদি CJK মোডকে ফিরে যেতে হয় কারণ আপনার ব্রাউজারে Intl.Segmenter নেই, টেবিলের নিচে একটি ছোট নোট দেখা যায় যাতে আপনি জানেন সেগমেন্টেশনটি ভাষাগতের বদলে প্রতি-অক্ষরে।
প্রধান বৈশিষ্ট্য#
- চারটি টোকেনাইজেশন মোড। কাঁচা গণনার জন্য স্পেস, পরিষ্কার শব্দ গণনার জন্য শব্দ, সঠিক চাইনিজ/জাপানিজ সেগমেন্টেশনের জন্য CJK, প্যাটার্ন আবিষ্কারের জন্য N-gram — একটি মোডের বদলে যা চারটির তিনটির জন্য ভুল।
- প্রকৃত CJK সেগমেন্টেশন।
Intl.Segmentergranularity: "word"সহ ব্যবহার করে, ব্রাউজারের বিল্ট-ইন ভাষাগত সেগমেন্টার, তাই我爱北京天安门শব্দ সীমানায় বিভক্ত হয়, অক্ষর অনুযায়ী কাটা হয় না। - সৎ ফলব্যাক। সেগমেন্টার অনুপলব্ধ হলে, টুলটি প্রতি-হান-অক্ষরে গণনায় অবনমিত হয় এবং আপনাকে জানায়, নীরবে ভিন্ন সংখ্যা তৈরি করার বদলে।
- অনুপাত, কেবল গণনা নয়। প্রতিটি সারি সমস্ত টোকেনের তার শতাংশ দেখায়, সম্পূর্ণ টেক্সটে গণনা করা — তাই একটি ১০,০০০-শব্দের নথির একটি Top-20 স্লাইসও অর্থপূর্ণ শতাংশ রিপোর্ট করে।
- CSV রপ্তানি। এক ক্লিকে একটি
token,count,shareফাইল ডাউনলোড হয়, একটি স্প্রেডশিট বা চার্টের জন্য প্রস্তুত। - নির্ধারিত ক্রম। টাই বর্ণানুক্রমিকভাবে ভাঙা হয় (টোকেন ঊর্ধ্বক্রম), তাই অভিন্ন ইনপুটে পুনরায় চালালে ব্রাউজার এবং ইঞ্জিন জুড়ে অভিন্ন আউটপুট হয়।
- ভারী-ইনপুট ওয়ার্কার। ~১ MB-এর উপরে ইনপুট একটি ব্যাকগ্রাউন্ড ওয়ার্কারে চলে যায়, তাই মেইন থ্রেড এবং পৃষ্ঠার বাকি অংশ প্রতিক্রিয়াশীল থাকে।
- স্থানীয় এবং নিরাপদ। টোকেনগুলো কেবল
textContentদিয়ে রেন্ডার করা হয় — ব্যবহারকারী-নিয়ন্ত্রিত টেক্সট কখনো একটি টেবিল সেল থেকে বেরোতে পারে না।
ব্যবহারের উদাহরণ#
এই ছোট লাইনটি ইনপুটে পেস্ট করুন, মোড = স্পেসে বিভক্ত এবং কেস-সংবেদনশীল নয় চালু সহ:
the quick brown fox the fox
সারাংশ রিপোর্ট করে 6 মোট টোকেন এবং 4 স্বতন্ত্র। সারিবদ্ধ টেবিলটি হলো:
| টোকেন | গণনা | অনুপাত |
|---|---|---|
| fox | 2 | 33.33% |
| the | 2 | 33.33% |
| brown | 1 | 16.67% |
| quick | 1 | 16.67% |
দুটি জিনিস লক্ষ্য করুন। প্রথমত, fox একই গণনা সত্ত্বেও the-এর উপরে সারিবদ্ধ, কারণ টাই বর্ণানুক্রমিকভাবে ভাঙা হয়। দ্বিতীয়ত, অনুপাতগুলো সমস্ত চারটি টোকেন জুড়ে 100% যোগ হয় — শতাংশগুলো কেবল প্রদর্শিত সারির বদলে সম্পূর্ণ টোকেন মোটের উপর গণনা করা হয়, তাই সেগুলো Top N লম্বা লেজ লুকিয়ে রাখলেও অর্থপূর্ণ থাকে।
এখন একই টেক্সটের উপর মোড আকার ২ সহ N-gram-এ পরিবর্তন করুন (সাদাসিধে সঙ্কুচিত): বিশ্লেষক th, he, e , q … এর মতো বাইগ্রাম তৈরি করে — আপনাকে দেখতে দেয় কোন অক্ষর জোড়া পুনরাবৃত্তি করে, যা আপনি কীভাবে সদৃশ প্রিফিক্স বা আটকে যাওয়া কীবোর্ড খুঁজবেন।
প্রশ্নোত্তর#
স্বাভাবিক ইংরেজি টেক্সটের জন্য আমার কোন মোড ব্যবহার করা উচিত?#
শব্দ (অক্ষর) লাতিন-স্ক্রিপ্ট গদ্যের জন্য সঠিক ডিফল্ট: এটি যতিচিহ্ন এবং সংখ্যা ছাড়া, তাই word, word. এবং word সবগুলো একই টোকেন হিসেবে গণনা হয়, এবং আপনি একটি পরিষ্কার শব্দভাণ্ডার গণনা পান। স্পেসে বিভক্ত কেবল তখন ব্যবহার করুন যখন যতিচিহ্ন নিজেই অর্থপূর্ণ (উদাহরণস্বরূপ, একটি লগে কাঁচা সাদাসিধে-বিভাজিত ফিল্ড গণনা করা)।
CJK মোড সত্যিই কীভাবে চাইনিজ বিভক্ষ করে?#
এটি ব্রাউজারের Intl.Segmenter granularity: "word" সহ কল করে, যা একটি প্রকৃত ভাষাগত সেগমেন্টার যে জানে চাইনিজ শব্দ কোথায় শুরু এবং শেষ হয়। তাই 我爱北京天安门 পাঁচটি আলাদা অক্ষরের বদলে প্রকৃত শব্দে বিভক্ত হয়। আপনার ব্রাউজার যদি Intl.Segmenter সমর্থন না করে, টুলটি প্রতি-অক্ষরে গণনায় ফিরে যায় এবং একটি নোট দেখায় — সংখ্যাগুলো ঘনত্ব তুলনার জন্য এখনও ব্যবহারযোগ্য, কেবল কম ভাষাগতভাবে নির্ভুল।
n-gram মোড কীসের জন্য?#
N-gram পুনরাবৃত্তিমূলক সাবস্ট্রিং প্রকাশ করে। একটি দীর্ঘ টেক্সটের উপর একটি ২-গ্রাম পাস দেখায় কোন অক্ষর বা অক্ষর জোড়া আধিপত্য করে; একটি ৩-গ্রাম বা ৪-গ্রাম পাস পুনরাবৃত্তিমূলক প্রিফিক্স, সাধারণ মর্ফিম, বা টাইপো ক্লাস্টার প্রকাশ করে। এটি কীওয়ার্ড-স্টাফিং অডিট, সাইফার বিশ্লেষণ, এবং অটোকমপ্লিট সারিবদ্ধকরণের পেছনের প্রমিল প্রযুক্তি।
আমার শতাংশগুলো কেন কেবল দেখানো Top N-এর বদলে সমস্ত টোকেনের উপর ভিত্তি করে?#
কারণ একটি শতাংশ কেবল প্রকৃত মোটের বিপরীতেই অর্থপূর্ণ। আপনি যদি একটি ৫,০০০-শব্দের প্রবন্ধের শীর্ষ ১০টি শব্দ চান, প্রতিটি শব্দের অংশ পুরো প্রবন্ধের তার স্লাইস প্রতিফলিত করা উচিত, দেখানো ১০টি শব্দের তার স্লাইস নয়। সম্পূর্ণ টোকেন মোটের উপর অনুপাত গণনা করলে টেবিল ছোট করা হলেও সংখ্যাগুলো সৎ থাকে।
আমার টেক্সট কি কোথাও আপলোড হয়?#
না। টোকেনাইজেশন, গণনা এবং CSV তৈরি সবই আপনার ব্রাউজারে চলে। বড় ইনপুট একটি ব্যাকগ্রাউন্ড ওয়ার্কার থ্রেডে চলে যায়, কিন্তু সেই থ্রেডও এই পৃষ্ঠারই অংশ — কিছুই একটি সার্ভারে পাঠানো হয় না।