Skip to main content
نقيس مبيان على مهام عربية مهنية، واتباع التعليمات، والاستدلال، والعمل متعدد اللغات، والأداء في الإنتاج. مبيان نموذج fine-tuned على أساس K2.6؛ لذلك تركز المقارنة مع Frontier Models على المهمة الفعلية لا على رقم عام واحد.

كيف نقارن بعدل

نستخدم نفس الأسئلة والسياق وحدود المخرجات ودرجة الحرارة والأدوات وطريقة التقييم لكل نموذج. نُبلغ عن حجم العينة وتاريخ الاختبار وإصدار البيانات، ولا نعرض أرقاماً تقديرية أو نتائج غير قابلة لإعادة الإنتاج.

عقد نشر النتائج

يجب أن تجيب كل بطاقة نتائج منشورة عن الأسئلة التي يحتاجها الباحث أو المشتري قبل الثقة بالمقارنة. الرقم بلا هذا السياق مادة تسويقية، لا نتيجة تقييم.
ستُنشر النتائج الرقمية مع نسخة التقييم والبيانات وإعدادات التوليد وطريقة التصحيح. لا نملأ هذه الصفحة بأرقام غير معتمدة.

ما الذي لا تقوله المقارنة العادلة

  • لا تدّعي فائزاً عاماً من لغة واحدة أو عائلة prompts واحدة أو حكم واحد.
  • لا تقارن نتيجة مبيان العربية المتخصصة مع نتيجة leaderboard عامة وغير مرتبطة لنموذج Frontier.
  • لا تخفي طول سياق مختلفاً أو سقف مخرج أو سياسة أدوات أو إعادة أو منطقة خلف رقم زمن واحد.
  • لا تحول قرار توجيه داخلي إلى ادعاء عن أوزان النموذج أو قدرة النموذج الأساسي.
هكذا نصوغ عبارة نافعة مثل: «حقق مبيان نسبة قبول أعلى لحمل عمل عربي مهني محدد ضمن ملف تشغيل معروف». هي أدق، وبالتالي أهم، من ادعاء تفوق شامل. للقرار الإنتاجي، اختبر أيضاً عيناتك الخاصة وقِس نسبة قبول المخرجات، ووقت التعديل، والتكلفة لكل مخرج مقبول، وأنواع الإخفاق: هلوسة، قيد مفقود، عربية ضعيفة، تنسيق خاطئ، أو timeout.