محلل تكرار الكلمات
النصاحسب تكرار الكلمات والـ n-gram للرموز في النص — الصينية عبر Intl.Segmenter، والكلمات اللاتينية عبر أحرف يونيكود أو المسافات — مع جدول Top-N والنسبة وتصدير CSV.
لا يتم جلب الروابط البعيدة؛ الصق JSON مباشرة.
في هذه الصفحة
ما هو محلّل تكرار الكلمات؟#
يقرأ محلّل تكرار الكلمات مجموعة نصّ ويَعُدّ كم مرّ يظهر كل رمز، ثم يرتّبها. إنه الأداة وراء فحوصات كثافة الكلمات المفتاحية لـ SEO، واكتشاف كلمات الإيقاف لفهارس البحث، وتقديرات حجم المفردات لتعلّم اللغة، ولوحة «الكلمات الأكثر شيوعًا» في أيّ محرّر نصّ جادّ. عُدّ الكلمات يدويًا فستُخطئ؛ اللحظة التي تدخل فيها الحالة والترقيم وتجزئة CJK، يفشل الحدس.
الجزء الصعب هو تحديد ما يُعَدّ رمزًا. تقدّم هذه الأداة أربعة أوضاع تجزئة، لأنّ الإجابة الصحيحة تعتمد على النصّ:
- تقسيم بالمسافات — تقسيم على أيّ مسافة. غير مرتبط بلغة؛ يُعامِل
Hello,وhelloكرمزَين مختلفَين بسبب الفاصلة والحرف الكبير. - كلمات (أحرف) — أقصى أجزاء أحرف Unicode (
\p{L}+). يُسقط الأرقام والترقيم، فتصبحHello,←Hello. الافتراضي الصحيح للنثر اللاتيني. - صينية (Intl.Segmenter) — يستخدم
Intl.Segmenterفي المتصفّح بدقة الكلمة لتجزئة لغوية صحيحة للنصّ الصيني/الياباني (我爱北京يتجزأ على حدود الكلمات الفعلية، لا لكل حرف). حين يفتقر المتصفّح للمُجزِّئ، يعود إلى عدّ كل حرف Han ويُحذِّرك. - n-gram للرموز — رموز n-gram حرفية بالحجم 2–5 فوق المجرى المُختزل المسافات، لتحليل الأنماط المتكررة وعناقيد الأخطاء المطبعية.
كل العدّ يجري محليًّا؛ وللمُدخلات فوق الميجابايت ينتقل إلى عامل خلفية لتبقى الصفحة متجاوبة.
كيفية الاستخدام#
- اختر الوضع في شريط الأدوات: تقسيم بالمسافات أوكلمات (أحرف) أوصينية (Intl.Segmenter) أوn-gram للرموز.
- اضبط أعلى N (الافتراضي 20، الأقصى 1000). لا يُعرض سوى هذا العدد من الصفوف المرتَّبة، لكنّ الإجماليات أسفل الجدول تعكس كل رمز دائمًا.
- إن اخترت n-gram، يظهر منتقي حجم الـ n-gram (2 أو3 أو4 أو5) — اختر طول الغرام.
- فعِّل أوعطِّل تجاهل حالة الأحرف (مفعّل افتراضيًّا). حين يكون مفعّلًا، تندمج
Theوtheفي عدّ واحد. - الصق نصّك في الجزء الأيسر، أ واضغط مثال لمقطع مدمج.
- اقرأ الجزء الأيمن: ملخّص (إجمالي الرموز، الرموز الفريدة) وجدول مرتَّب للرمز / العدّ / النسبة. استخدم نسخ للجدول أوتنزيل CSV لملف
token,count,shareتفتحه في أيّ جداول بيانات.
إن كان على وضع CJK العودة لأنّ متصفّحك يفتقر Intl.Segmenter، تظهر ملاحظة صغيرة أسفل الجدول لتعرف أنّ التجزئة لكل حرف لا لغوية.
الميزات الرئيسية#
- أربعة أوضاع تجزئة. تقسيم بالمسافات لعدّ خام، وكلمات (أحرف) لعدّ كلمات نظيف، وصينية (Intl.Segmenter) لتجزئة صينية/يابانية صحيحة، وn-gram لاكتشاف الأنماط — بدلًا من وضع واحد خطأ لثلاثة من أصل أربعة نصوص.
- تجزئة CJK حقيقية. يستخدم
Intl.Segmenterمعgranularity: "word"، المُجزِّئ اللغوي المدمج في المتصفّح، فيُجزَّأ我爱北京天安门على حدود الكلمات لا يُمزَّق حرفًا بحرف. - عودة صادقة. حين يكون المُجزِّئ غير متاح، تتدهور الأداة إلى عدّ كل حرف Han وتُخبرك أنّها فعلت، بدلًا من إنتاج أرقام مختلفة بصمت.
- نصة لا عدّ فحسب. كل صف يُظهر نسبته المئوية من كل الرموز، محسوبةً فوق النصّ الكامل — فحتى شريحة أعلى-20 من مستند 10,000 كلمة تُبلغ عن نسب مئوية ذات معنى.
- تصدير CSV. نقرة واحدة تنزّل ملف
token,count,share، جاهز لجداول بيانات أورسم بياني. - ترتيب حتمي. تُكسر التعادلات أبجديًّا (الرمز تصاعديًّا)، فيُنتج إعادة التشغيل على مُدخل متطابق مُخرجًا متطابقًا عبر المتصفّحات والمحرّكات.
- عامل للمُدخلات الثقيلة. المُدخلات فوق ~1 ميغابايت تنتقل إلى عامل خلفية، فيبقى الخيط الرئيسي وبقية الصفحة متجاوبَين.
- محلّي وآمن. الرموز تُعرَض بـ
textContentفقط — لا يستطيع النصّ المتحكَّم به الاختراق من خلية جدول قطعًا.
مثال عملي#
الصق هذا السطر القصير في المُدخل، مع الوضع = تقسيم بالمسافات وتجاهل حالة الأحرف مفعّلًا:
the quick brown fox the fox
يُبلغ الملخّص عن 6 رموز إجمالية و4 فريدة. الجدول المرتَّب:
| Token | Count | Share |
|---|---|---|
| fox | 2 | 33.33% |
| the | 2 | 33.33% |
| brown | 1 | 16.67% |
| quick | 1 | 16.67% |
أمران للملاحظة. أولًا، يرتّب fox فوق the رغم العدّ ذاته، لأنّ التعادل يُكسر أبجديًّا. ثانيًا، النسب تُجمَّع إلى 100% عبر الرموز الأربعة جميعًا — تُحسب النسب المئوية فوق إجمالي الرموز الكامل لا الصفوف المعروضة فقط، فتبقى ذات معنى حتى حين يُخفي أعلى N الذيل الطويل.
الآن بدّل الوضع إلى n-gram بالحجم 2 فوق النصّ ذاته (المسافات مُختزلة): يُنتج المحلّل ثنائيات رموز مثل th وhe وe و q … داعيةً إياك لرؤية أيّ أزواج الحروف تتكرر، وهو كيف تطارد البادئات المكررة أولوحة مفاتيح عالقة.
الأسئلة الشائعة#
أيّ وضع أنبغي استخدامه للنصّ الإنجليزي العادي؟#
كلمات (أحرف) هو الافتراضي الصحيح للنثر اللاتيني: يُجرِّد الترقيم والأرقام، فتُعَدّ word, وword. وword كلها كالرمز ذاته، وتحصل على عدّ مفردات نظيف. استخدم تقسيم بالمسافات فقط حين يكون الترقيم نفسه ذا معنى (مثلًا، عدّ حقول خام مفصولة بمسافات في سجلّ).
كيف يُجزِّئ وضع CJK الصينية فعلًا؟#
يستدعي Intl.Segmenter في المتصفّح مع granularity: "word"، وهو مُجزِّئ لغوي حقيقي يعرف أين تبدأ الكلمات الصينية وتنتهي. فيتجزأ 我爱北京天安门 إلى كلمات فعلية بدلًا من خمسة أحرف منفصلة. إن لم يدعم متصفّحك Intl.Segmenter، تعود الأداة إلى عدّ كل حرف وتُظهر ملاحظة — تبقى الأرقام قابلة للاستخدام لمقارنة الكثافة، فقط أقل دقة لغويًّا.
الغرض من وضع n-gram؟#
تكشف الـ n-gram السلاسل الفرعية المتكررة. تُمرِّر 2-gram فوق نصّ طويل تُظهر أيّ أزواج حروف أورموز تسود؛ وتُظهر تمريرة 3-gram أو4-gram البادئات المتكررة، والصِّرفَات الشائعة، أوعناقيد الأخطاء المطبعية. إنها التقنية المعيارية وراء تدقيق حشو الكلمات المفتاحية، وتحليل الشفرات، وترتيب الإكمال التلقائي.
لماذا نسبَي المئوية مبنية على كل الرموز لا على أعلى N المعروض فقط؟#
لأنّ النسبة المئوية ذات معنى فقط مقابل الإجمالي الحقيقي. إن طلبت أعلى 10 كلمات في مقال 5,000 كلمة، يجب أن تعكس حصة كل كلمة شريحتها من المقال كله لا شريحتها من الـ 10 كلمات المعروضة. حساب النسبة فوق إجمالي الرموز الكامل يُبقي الأرقام صادقة حتى حين يُقتطع الجدول.
هل نصّي يُرفع إلى أيّ مكان؟#
لا. التجزئة والعدّ وتوليد CSV كلها تجري في متصفّحك. المُدخلات الكبيرة تنتقل إلى خيط عامل خلفية، لكنّ ذلك الخيط لا يزال جزءًا من هذه الصفحة — لا شيء يُرسَل إلى خادم.