> ## Documentation Index
> Fetch the complete documentation index at: https://docs.mibyanai.com/llms.txt
> Use this file to discover all available pages before exploring further.

# اختبارات Benchmark لنموذج مبيان

> منهجية قياس العربية واتباع التعليمات والاستدلال والأداء الإنتاجي

نقيس مبيان على مهام عربية مهنية، واتباع التعليمات، والاستدلال، والعمل متعدد اللغات، والأداء في الإنتاج. مبيان نموذج fine-tuned على أساس K2.6؛ لذلك تركز المقارنة مع Frontier Models على المهمة الفعلية لا على رقم عام واحد.

## كيف نقارن بعدل

نستخدم نفس الأسئلة والسياق وحدود المخرجات ودرجة الحرارة والأدوات وطريقة التقييم لكل نموذج. نُبلغ عن حجم العينة وتاريخ الاختبار وإصدار البيانات، ولا نعرض أرقاماً تقديرية أو نتائج غير قابلة لإعادة الإنتاج.

| المسار          | ما نقيسه                                                     |
| --------------- | ------------------------------------------------------------ |
| العربية المهنية | الفصاحة، المصطلحات، التلخيص، إعادة الصياغة، والدقة           |
| اتباع التعليمات | تحقق كل القيود المطلوبة والصيغة والنبرة                      |
| الاستدلال       | نسبة الإجابات الصحيحة أو تقييم rubric للمسائل متعددة الخطوات |
| الإنتاج         | p50 وp95 للزمن، معدل النجاح، البث، والتكلفة                  |

## عقد نشر النتائج

يجب أن تجيب كل بطاقة نتائج منشورة عن الأسئلة التي يحتاجها الباحث أو المشتري قبل الثقة بالمقارنة. الرقم بلا هذا السياق مادة تسويقية، لا نتيجة تقييم.

| الحقل المطلوب   | قاعدة النشر                                                                       |
| --------------- | --------------------------------------------------------------------------------- |
| هوية الإصدار    | نذكر معرف النموذج العام وتاريخ التقييم وإصدار الـharness                          |
| مصدر البيانات   | نصف dataset المحجوز وخليط اللغات وعائلات المهام والاستثناءات                      |
| إعدادات التشغيل | ننشر قالب prompt وإعدادات التوليد وحدود السياق والمخرج والأدوات وسياسة الإعادة    |
| التصحيح         | نسمّي المقياس وrubric والحكم الآلي أو المراجعة البشرية وسياسة الحسم               |
| عدم اليقين      | نذكر حجم العينة والتباين أو confidence interval أو سبب عدم توفرها صراحة           |
| تحليل الإخفاق   | نفصل القيد المفقود والخطأ الواقعي وخطأ اللغة وخطأ التنسيق والـtimeout وخطأ الأداة |
| سياق التشغيل    | لادعاءات الزمن أو التكلفة، نذكر المنطقة والتزامن وهل فُعل البث والإعادات          |

<Note>ستُنشر النتائج الرقمية مع نسخة التقييم والبيانات وإعدادات التوليد وطريقة التصحيح. لا نملأ هذه الصفحة بأرقام غير معتمدة.</Note>

## ما الذي لا تقوله المقارنة العادلة

* لا تدّعي فائزاً عاماً من لغة واحدة أو عائلة prompts واحدة أو حكم واحد.
* لا تقارن نتيجة مبيان العربية المتخصصة مع نتيجة leaderboard عامة وغير مرتبطة لنموذج Frontier.
* لا تخفي طول سياق مختلفاً أو سقف مخرج أو سياسة أدوات أو إعادة أو منطقة خلف رقم زمن واحد.
* لا تحول قرار توجيه داخلي إلى ادعاء عن أوزان النموذج أو قدرة النموذج الأساسي.

هكذا نصوغ عبارة نافعة مثل: **«حقق مبيان نسبة قبول أعلى لحمل عمل عربي مهني محدد ضمن ملف تشغيل معروف»**. هي أدق، وبالتالي أهم، من ادعاء تفوق شامل.

للقرار الإنتاجي، اختبر أيضاً عيناتك الخاصة وقِس نسبة قبول المخرجات، ووقت التعديل، والتكلفة لكل مخرج مقبول، وأنواع الإخفاق: هلوسة، قيد مفقود، عربية ضعيفة، تنسيق خاطئ، أو timeout.
