انتقل إلى المحتوى
mathbehind

محوّل الرموز (Tokens) إلى عدد الكلمات

قدّر عدد الرموز (tokens) التي سيستهلكها نص ما، أو عدد الكلمات التي تتيحها ميزانية من الرموز، باستخدام القاعدة التقريبية الشائعة: نحو 4 أحرف لكل رمز.

أرقامك

أدخل عدد الكلمات أو عدد الرموز بما يتوافق مع الاختيار أعلاه.

الرموز المقدّرة

1,000

عدد الكلمات المقدّر

750

عدد الأحرف المقدّر
4,000
الحساب الذي وراء النتيجة
  1. الرموز

    750 كلمة ÷ 0.75يساوي1,000

تحتسب كل واجهات API الكبرى لنماذج LLM الأسعار بالرموز (tokens) لا بالكلمات أو الأحرف، لكن أكثر الناس يفكرون بالكلمات عند كتابة المطالبة. تحوّل هذه الحاسبة بين الاثنين بالقاعدة التقريبية المعتمدة للنص الإنجليزي (نحو 750 كلمة لكل 1,000 رمز)، لتقدّر استهلاك الرموز قبل أن تكتب سطرًا واحدًا من شيفرة API.

روجعت الأرقام في بواسطة Muhammad Ahmad بالاستناد إلى مركز مساعدة OpenAI: ما هي الرموز وكيف تُعدّ. الأسعار والقواعد تتغير، فتأكد من المصدر الرسمي قبل الاعتماد عليها. كيف نتحقق من الحسابات

كيف تعمل

يعتمد التحويل على التقريب المنشور على نطاق واسع بأن 1,000 رمز تساوي نحو 750 كلمة من النص الإنجليزي المعتاد. أي أن الرمز الواحد يساوي نحو 0.75 كلمة، أو نحو 4 أحرف.

هذه قاعدة تقريبية لا عدّ دقيق. فأدوات الترميز الفعلية (مثل tiktoken من OpenAI أو أداة الترميز من Anthropic) تقسّم النص إلى أجزاء أصغر من الكلمات بحسب مفردات تدريب النموذج، فقد تزيد علامات الترقيم والأرقام والشيفرة والنصوص غير الإنجليزية والتنسيق غير المعتاد عدد الرموز الفعلي أو تنقصه بشكل ملحوظ عن هذا التقدير.

لتقدير سريع عند التخطيط (تحديد حجم مطالبة، أو التحقق من أنها تناسب نافذة السياق، أو تقدير التكلفة قبل استخدام حاسبة تكلفة API الذكاء الاصطناعي)، يكون هذا التقريب كافيًا عادةً. أما العدّ الدقيق الذي تُبنى عليه الفواتير، فاستخدم أداة الترميز الرسمية لمزوّد النموذج.

مثال محلول

750 كلمة من نثر إنجليزي معتاد تتحول إلى نحو 1,000 رمز مقدّر وقرابة 4,000 حرف، وهو تقدير مفيد قبل مقارنة المطالبة بحد نافذة السياق الدقيق للنموذج.

أمثلة إضافية

200,000 رمز تساوي نحو 150,000 كلمة إنجليزية، وقرابة 800,000 حرف، أي ما يعادل طول روايتين تقريبًا.

أخطاء شائعة

  • تطبيق القاعدة الإنجليزية على الشيفرة أو اللغات الأخرى، فهي تستهلك رموزًا أكثر لكل كلمة.
  • افتراض أن أداة الترميز في كل نموذج تعدّ بالطريقة نفسها.
  • نسيان مطالبات النظام وتعريفات الأدوات وسجل المحادثة، فكلها تُحتسب رموزًا.
  • استخدام التقديرات في الفوترة؛ استخدم عدّاد الرموز لدى المزوّد عندما تكون الدقة مطلوبة.

أسئلة يطرحها الناس

لماذا لا يساوي الرمز الواحد كلمة واحدة؟

تقسّم أدوات الترميز النص إلى أجزاء أصغر من الكلمات لا إلى كلمات كاملة. فالكلمات الشائعة تكون غالبًا رمزًا واحدًا، بينما تنقسم الكلمات الأطول أو الأقل شيوعًا إلى عدة رموز. وفي المتوسط يعادل هذا نحو 0.75 كلمة لكل رمز في النص الإنجليزي المعتاد، ومنه جاء تقدير 750 كلمة لكل 1,000 رمز.

هل يصلح هذا للشيفرة أو للنصوص غير الإنجليزية؟

بدقة أقل. فالشيفرة تستهلك رموزًا أكثر لكل حرف من النثر بسبب الرموز والمسافات البادئة والمعرّفات؛ واللغات غير الإنجليزية (خاصة ذات الكتابات غير اللاتينية) تُرمَّز غالبًا بكفاءة أقل من الإنجليزية، وقد تحتاج أحيانًا إلى 2-3 أضعاف الرموز للكمية الظاهرة نفسها من النص.

كيف أحصل على عدد دقيق للرموز بدل التقدير؟

استخدم أداة الترميز الخاصة بالمزوّد نفسه. تنشر OpenAI أداة tiktoken، وتوفّر Anthropic وGoogle نقاط وصول ومكتبات خاصة بهما لعدّ الرموز. هذه الحاسبة للتخطيط السريع، لا لرقم تحاسب به عميلًا.

ما علاقة هذه الأداة بحاسبة تكلفة API الذكاء الاصطناعي؟

تقدّر هذه الأداة عدد الرموز التي سيستهلكها نصك؛ أما حاسبة تكلفة API الذكاء الاصطناعي فتحوّل عدد الرموز إلى تكلفة بالدولار لنموذج محدد. استخدم هذه الأداة أولًا إذا كنت تعرف عدد كلمات مطالبتك فقط، ثم أدخل تقدير الرموز الناتج في حاسبة التكلفة.

كم كلمة تساوي 1,000 رمز؟

نحو 750 كلمة إنجليزية، أي بمعدل 1.33 رمز تقريبًا للكلمة. أما في العربية والأردية ولغات كثيرة أخرى فعدد الكلمات أقل، وغالبًا بين 350 و500، لأن كل كلمة تستهلك رموزًا أكثر.