التقدير ليس رقمًا رسميًا. كل نموذج يستخدم tokenizer مختلفًا.
لماذا يهم token؟
النموذج لا يرى النص كعدد كلمات عادي، بل كوحدات تسمى token. عندما يكون النص طويلًا جدًا، قد لا يقرأه كاملًا أو تنخفض جودة الإجابة. استخدم التقدير لتقرر هل تختصر النص أو تقسّمه.
لماذا يستهلك النص العربي عددًا أكبر من الرموز؟
دُرِّبت أدوات التقسيم على نصوص إنجليزية في المقام الأول، وهذا يظهر في الحساب. الكلمة العربية تحمل غالبًا أدوات وضمائر ملتصقة بها، مثل وبمساعدتهم، فتبدو كلمة واحدة على الشاشة بينما يقسّمها النموذج إلى عدة أجزاء. النتيجة أن فقرة قصيرة المظهر قد تستهلك رموزًا أكثر مما تتوقع.
يضاف إلى ذلك أثر التشكيل. كتابة الحركات فوق الحروف تزيد عدد الرموز دون أن تضيف معنى يحتاجه النموذج، لذلك يفضّل إزالتها من النصوص الطويلة قبل لصقها. التقدير أعلاه يعكس هذا الفارق بشكل تقريبي، وللأرقام الدقيقة استخدم الأداة الرسمية للنموذج الذي تعمل عليه.
ماذا تفعل بعد رؤية الرقم؟
قارن التقدير بحد السياق في النموذج الذي تستخدمه. إذا اقترب الرقم من الحد فلا تفترض أن النص قُرئ بالكامل. أمامك طريقان: تقسيم المادة إلى أجزاء يقوم كل منها بذاته، أو تنظيفها أولًا مما لا لزوم له. فهرس المحتويات والعناوين المتكررة وتوقيع البريد والمرفقات البعيدة عن الموضوع هي أول ما يُحذف عادة.
في المستندات الطويلة يفيد هذا الترتيب: اكتب أولًا في جملة واحدة ما تريد معرفته، ثم الصق المقاطع المرتبطة بهذا السؤال فقط. اختيارك للمقطع الصحيح بنفسك أقل كلفة وأدق من انتظار أن يعثر عليه النموذج وسط نص طويل.
وملاحظة أخيرة: عدد الرموز لا يتعلق بالحد فقط بل بالتكلفة أيضًا. عند العمل عبر الواجهة البرمجية يُحسب النص المُرسل والرد القادم كل على حدة. لذلك بدل لصق المستند نفسه مع كل سؤال، اطلب ملخصًا مرة واحدة ثم تابع النقاش على الملخص؛ أرخص وأدق في الوقت نفسه.
أسئلة شائعة
هل الرقم دقيق؟
لا، هو تقدير.
هل يرفع النص؟
لا.
ماذا أفعل إذا كان النص طويلًا؟
قسّمه إلى أجزاء أو اطلب ملخصًا مرحليًا.
هل يحسب المخرجات؟
لا، يقدّر المدخلات أساسًا.