টুল
গাইড

শব্দ ফ্রিকোয়েন্সি বিশ্লেষক

টেক্সট

টেক্সটে শব্দ এবং ক্যারেক্টার n-gram ফ্রিকোয়েন্সি গণনা করুন — CJK-র জন্য Intl.Segmenter, ল্যাটিন শব্দের জন্য ইউনিকোড অক্ষর বা স্পেস — Top-N টেবিল, অনুপাত এবং CSV রপ্তানি সহ।

100% ক্লায়েন্ট-সাইড কোনো ব্যাকএন্ড নেই

দূরবর্তী URL আনা হয় না; আপনার JSON সরাসরি পেস্ট করুন।

ইনপুট
আউটপুট
শব্দ ফ্রিকোয়েন্সি বিশ্লেষণ করতে টেক্সট লিখুন।
এই পৃষ্ঠায়

শব্দ ফ্রিকোয়েন্সি বিশ্লেষক কী?#

একটি শব্দ ফ্রিকোয়েন্সি বিশ্লেষক একটি টেক্সট বডি পড়ে এবং প্রতিটি টোকেন কতবার দেখা যায় তা গণনা করে, তারপর সেগুলোকে সারিবদ্ধ করে। এটি SEO-এর জন্য কীওয়ার্ড ঘনত্ব চেক, অনুসন্ধান সূচকের জন্য stopword আবিষ্কার, ভাষা শেখার জন্য শব্দভাণ্ডার-আকার অনুমান, এবং যেকোনো গুরুতর টেক্সট এডিটরে “সবচেয়ে সাধারণ শব্দ” প্যানেলের পেছনের টুল। হাতে শব্দ গণনা করলে আপনি ভুল হবেন; কেস, যতিচিহ্ন এবং CJK সেগমেন্টেশন ছবিতে প্রবেশ করার সাথে সাথে অন্তর্দৃষ্টি ব্যর্থ হয়।

কঠিন অংশ হলো স্থির করা কী একটি টোকেন হিসেবে গণনা করে। এই টুল চারটি টোকেনাইজেশন মোড সরবরাহ করে, কারণ সঠিক উত্তর টেক্সটের উপর নির্ভর করে:

  • স্পেসে বিভক্ত — যেকোনো সাদাসিধেতে বিভক্ত। ভাষা-অজ্ঞেয়; Hello, এবং hello-কে আলাদা টোকেন হিসেবে বিবেচনা করে কারণ কমা এবং বড় হাতের কারণে।
  • শব্দ (অক্ষর) — Unicode অক্ষরের সর্বোচ্চ রান (\p{L}+)। সংখ্যা এবং যতিচিহ্ন বাদ দেয়, তাই Hello, হয়ে যায় Hello। লাতিন-স্ক্রিপ্ট গদ্যের জন্য সঠিক ডিফল্ট।
  • CJK — চাইনিজ/জাপানিজ টেক্সটের সঠিক ভাষাগত সেগমেন্টেশনের জন্য ব্রাউজারের Intl.Segmenter ব্যবহার করে শব্দ গ্রানুলারিটিতে (我爱北京 প্রতি অক্ষরে নয়, প্রকৃত শব্দ সীমানায় বিভক্ত হয়)। ব্রাউজারে সেগমেন্টার না থাকলে, এটি প্রতি-হান-অক্ষরে গণনায় ফিরে যায় এবং আপনাকে সতর্ক করে।
  • ক্যারেক্টার n-gram — সাদাসিধে-সঙ্কুচিত স্ট্রিমের উপর ২–৫ আকারের অক্ষর n-গ্রাম, পুনরাবৃত্তি-প্যাটার্ন এবং টাইপো-ক্লাস্টার বিশ্লেষণের জন্য।

সমস্ত গণনা স্থানীয়ভাবে চলে; এক মেগাবাইটের উপরে ইনপুটের জন্য এটি একটি ব্যাকগ্রাউন্ড ওয়ার্কারে চলে যায় যাতে পৃষ্ঠাটি প্রতিক্রিয়াশীল থাকে।

কীভাবে ব্যবহার করবেন#

  1. টুলবারে মোড বাছুন: স্পেসে বিভক্ত, শব্দ (অক্ষর), CJK, বা ক্যারেক্টার n-gram।
  2. Top-N সেট করুন (ডিফল্ট ২০, সর্বোচ্চ ১০০০)। কেবল ততগুলো সারিবদ্ধ সারি দেখানো হয়, কিন্তু টেবিলের নিচের মোটগুলো সর্বদা প্রতিটি টোকেন প্রতিফলিত করে।
  3. আপনি যদি N-gram বাছেন, একটি আকার নির্বাচক (২, ৩, ৪ বা ৫) দেখা যায় — গ্রাম দৈর্ঘ্য বাছুন।
  4. কেস-সংবেদনশীল নয় টিক দিন বা তুলে দিন (ডিফল্ট চালু)। চালু থাকলে, The এবং the একটি গণনায় একত্রিত হয়।
  5. আপনার টেক্সট বাম পেনে পেস্ট করুন, বা একটি বিল্ট-ইন প্যাসেজের জন্য নমুনা চাপুন।
  6. ডান পেন পড়ুন: একটি সারাংশ (মোট টোকেন, স্বতন্ত্র টোকেন) এবং টোকেন / গণনা / অনুপাতের একটি সারিবদ্ধ টেবিল। টেবিলের জন্য কপি বা যেকোনো স্প্রেডশিটে খোলার জন্য একটি token,count,share ফাইলের জন্য CSV ডাউনলোড ব্যবহার করুন।

যদি CJK মোডকে ফিরে যেতে হয় কারণ আপনার ব্রাউজারে Intl.Segmenter নেই, টেবিলের নিচে একটি ছোট নোট দেখা যায় যাতে আপনি জানেন সেগমেন্টেশনটি ভাষাগতের বদলে প্রতি-অক্ষরে।

প্রধান বৈশিষ্ট্য#

  • চারটি টোকেনাইজেশন মোড। কাঁচা গণনার জন্য স্পেস, পরিষ্কার শব্দ গণনার জন্য শব্দ, সঠিক চাইনিজ/জাপানিজ সেগমেন্টেশনের জন্য CJK, প্যাটার্ন আবিষ্কারের জন্য N-gram — একটি মোডের বদলে যা চারটির তিনটির জন্য ভুল।
  • প্রকৃত CJK সেগমেন্টেশন। Intl.Segmenter granularity: "word" সহ ব্যবহার করে, ব্রাউজারের বিল্ট-ইন ভাষাগত সেগমেন্টার, তাই 我爱北京天安门 শব্দ সীমানায় বিভক্ত হয়, অক্ষর অনুযায়ী কাটা হয় না।
  • সৎ ফলব্যাক। সেগমেন্টার অনুপলব্ধ হলে, টুলটি প্রতি-হান-অক্ষরে গণনায় অবনমিত হয় এবং আপনাকে জানায়, নীরবে ভিন্ন সংখ্যা তৈরি করার বদলে।
  • অনুপাত, কেবল গণনা নয়। প্রতিটি সারি সমস্ত টোকেনের তার শতাংশ দেখায়, সম্পূর্ণ টেক্সটে গণনা করা — তাই একটি ১০,০০০-শব্দের নথির একটি Top-20 স্লাইসও অর্থপূর্ণ শতাংশ রিপোর্ট করে।
  • CSV রপ্তানি। এক ক্লিকে একটি token,count,share ফাইল ডাউনলোড হয়, একটি স্প্রেডশিট বা চার্টের জন্য প্রস্তুত।
  • নির্ধারিত ক্রম। টাই বর্ণানুক্রমিকভাবে ভাঙা হয় (টোকেন ঊর্ধ্বক্রম), তাই অভিন্ন ইনপুটে পুনরায় চালালে ব্রাউজার এবং ইঞ্জিন জুড়ে অভিন্ন আউটপুট হয়।
  • ভারী-ইনপুট ওয়ার্কার। ~১ MB-এর উপরে ইনপুট একটি ব্যাকগ্রাউন্ড ওয়ার্কারে চলে যায়, তাই মেইন থ্রেড এবং পৃষ্ঠার বাকি অংশ প্রতিক্রিয়াশীল থাকে।
  • স্থানীয় এবং নিরাপদ। টোকেনগুলো কেবল textContent দিয়ে রেন্ডার করা হয় — ব্যবহারকারী-নিয়ন্ত্রিত টেক্সট কখনো একটি টেবিল সেল থেকে বেরোতে পারে না।

ব্যবহারের উদাহরণ#

এই ছোট লাইনটি ইনপুটে পেস্ট করুন, মোড = স্পেসে বিভক্ত এবং কেস-সংবেদনশীল নয় চালু সহ:

the quick brown fox the fox

সারাংশ রিপোর্ট করে 6 মোট টোকেন এবং 4 স্বতন্ত্র। সারিবদ্ধ টেবিলটি হলো:

টোকেনগণনাঅনুপাত
fox233.33%
the233.33%
brown116.67%
quick116.67%

দুটি জিনিস লক্ষ্য করুন। প্রথমত, fox একই গণনা সত্ত্বেও the-এর উপরে সারিবদ্ধ, কারণ টাই বর্ণানুক্রমিকভাবে ভাঙা হয়। দ্বিতীয়ত, অনুপাতগুলো সমস্ত চারটি টোকেন জুড়ে 100% যোগ হয় — শতাংশগুলো কেবল প্রদর্শিত সারির বদলে সম্পূর্ণ টোকেন মোটের উপর গণনা করা হয়, তাই সেগুলো Top N লম্বা লেজ লুকিয়ে রাখলেও অর্থপূর্ণ থাকে।

এখন একই টেক্সটের উপর মোড আকার ২ সহ N-gram-এ পরিবর্তন করুন (সাদাসিধে সঙ্কুচিত): বিশ্লেষক th, he, e , q … এর মতো বাইগ্রাম তৈরি করে — আপনাকে দেখতে দেয় কোন অক্ষর জোড়া পুনরাবৃত্তি করে, যা আপনি কীভাবে সদৃশ প্রিফিক্স বা আটকে যাওয়া কীবোর্ড খুঁজবেন।

প্রশ্নোত্তর#

স্বাভাবিক ইংরেজি টেক্সটের জন্য আমার কোন মোড ব্যবহার করা উচিত?#

শব্দ (অক্ষর) লাতিন-স্ক্রিপ্ট গদ্যের জন্য সঠিক ডিফল্ট: এটি যতিচিহ্ন এবং সংখ্যা ছাড়া, তাই word, word. এবং word সবগুলো একই টোকেন হিসেবে গণনা হয়, এবং আপনি একটি পরিষ্কার শব্দভাণ্ডার গণনা পান। স্পেসে বিভক্ত কেবল তখন ব্যবহার করুন যখন যতিচিহ্ন নিজেই অর্থপূর্ণ (উদাহরণস্বরূপ, একটি লগে কাঁচা সাদাসিধে-বিভাজিত ফিল্ড গণনা করা)।

CJK মোড সত্যিই কীভাবে চাইনিজ বিভক্ষ করে?#

এটি ব্রাউজারের Intl.Segmenter granularity: "word" সহ কল করে, যা একটি প্রকৃত ভাষাগত সেগমেন্টার যে জানে চাইনিজ শব্দ কোথায় শুরু এবং শেষ হয়। তাই 我爱北京天安门 পাঁচটি আলাদা অক্ষরের বদলে প্রকৃত শব্দে বিভক্ত হয়। আপনার ব্রাউজার যদি Intl.Segmenter সমর্থন না করে, টুলটি প্রতি-অক্ষরে গণনায় ফিরে যায় এবং একটি নোট দেখায় — সংখ্যাগুলো ঘনত্ব তুলনার জন্য এখনও ব্যবহারযোগ্য, কেবল কম ভাষাগতভাবে নির্ভুল।

n-gram মোড কীসের জন্য?#

N-gram পুনরাবৃত্তিমূলক সাবস্ট্রিং প্রকাশ করে। একটি দীর্ঘ টেক্সটের উপর একটি ২-গ্রাম পাস দেখায় কোন অক্ষর বা অক্ষর জোড়া আধিপত্য করে; একটি ৩-গ্রাম বা ৪-গ্রাম পাস পুনরাবৃত্তিমূলক প্রিফিক্স, সাধারণ মর্ফিম, বা টাইপো ক্লাস্টার প্রকাশ করে। এটি কীওয়ার্ড-স্টাফিং অডিট, সাইফার বিশ্লেষণ, এবং অটোকমপ্লিট সারিবদ্ধকরণের পেছনের প্রমিল প্রযুক্তি।

আমার শতাংশগুলো কেন কেবল দেখানো Top N-এর বদলে সমস্ত টোকেনের উপর ভিত্তি করে?#

কারণ একটি শতাংশ কেবল প্রকৃত মোটের বিপরীতেই অর্থপূর্ণ। আপনি যদি একটি ৫,০০০-শব্দের প্রবন্ধের শীর্ষ ১০টি শব্দ চান, প্রতিটি শব্দের অংশ পুরো প্রবন্ধের তার স্লাইস প্রতিফলিত করা উচিত, দেখানো ১০টি শব্দের তার স্লাইস নয়। সম্পূর্ণ টোকেন মোটের উপর অনুপাত গণনা করলে টেবিল ছোট করা হলেও সংখ্যাগুলো সৎ থাকে।

আমার টেক্সট কি কোথাও আপলোড হয়?#

না। টোকেনাইজেশন, গণনা এবং CSV তৈরি সবই আপনার ব্রাউজারে চলে। বড় ইনপুট একটি ব্যাকগ্রাউন্ড ওয়ার্কার থ্রেডে চলে যায়, কিন্তু সেই থ্রেডও এই পৃষ্ঠারই অংশ — কিছুই একটি সার্ভারে পাঠানো হয় না।