> ## Documentation Index
> Fetch the complete documentation index at: https://docs.mibyanai.com/llms.txt
> Use this file to discover all available pages before exploring further.

# التقرير التقني

> مبيان 4.1: اتجاه التهيئة وسلوك النظام والتقييم والمساءلة التشغيلية

يشرح هذا التقرير كيف يُطوّر مبيان 4.1 ويُقيّم كنظام نموذج عربي الأولوية. وهو موجه للباحثين والمشترين التقنيين وفرق المنتجات التي تحتاج أكثر من جدول Benchmark قبل إدخال نموذج في سير عمل حقيقي.

## الملخص التنفيذي

يبدأ مبيان من أساس K2.6 ثم يُهيأ للعمل المهني العربي. ويركز العمل على ملاءمة اللغة وحفظ القيود والمخرجات المنظمة والسياقات ثنائية اللغة وحد خدمة متحكم فيه. نقيم الناتج كنظام: الجودة وزمن الاستجابة والاعتمادية وقابلية التعافي تُقرأ معاً.

نميز عمداً بين ما ننشره وما هو حساس تشغيلياً. يشرح التقرير السلوك والمنهج، ولا ينشر بيانات العملاء الخاصة أو بيانات الاعتماد أو المضيفات الداخلية أو إعدادات التوجيه الحية.

## التدريب الإضافي وFine-tuning

يُطوّر مبيان مع تركيز على العربية والعمل العملي: العربية الفصحى، المصطلحات الخليجية، المزج بين العربية والإنجليزية، الكتابة المهنية، المخرجات المنظمة، واتباع التعليمات.

الهدف ليس جعل النص العربي فصيحاً فقط، بل تحسين السلوك الكامل: فهم الطلب الناقص، الحفاظ على القيود، اختيار هيكل مفيد، وإنتاج مخرج يمكن مراجعته وتحريره.

### مبادئ التهيئة

| المبدأ                 | لماذا يهم                                                         | اختبار يمكن ملاحظته                                          |
| ---------------------- | ----------------------------------------------------------------- | ------------------------------------------------------------ |
| ملاءمة اللغة الإقليمية | الترجمة الحرفية تفقد السجل والمعنى التجاري                        | يراجع خبراء المصطلحات والنبرة والنية في مهام عربية محجوزة    |
| إكمال يبدأ بالقيود     | قد تكون الإجابة أنيقة لكنها لا تلبي الطلب                         | يحسب المصحح كل صيغة وطول وجمهور واستثناء مطلوب               |
| استمرارية ثنائية اللغة | العمل الحقيقي يتنقل كثيراً بين العربية والإنجليزية في prompt واحد | تختبر المهام المختلطة حفظ المعنى عبر الحد الفاصل بين اللغتين |
| فائدة منظمة            | يجب أن تكون مادة العمل قابلة لإعادة الاستخدام للبشر أو التطبيق    | تُتحقق الـschemas والأقسام والحقول قبل تقييم الأسلوب         |
| عدم يقين صريح          | الاختلاق الفصيح أخطر من إجابة محدودة بوضوح                        | يفصل تحليل الإخفاق الادعاء غير المدعوم عن عدم اليقين المعلن  |

## حد النموذج والنظام

يظهر النموذج عبر المعرف العام المستقر `mibyan-4.1` وعقد متوافق مع OpenAI. هذا الحد متعمد: تتكامل التطبيقات مع واجهة ثابتة، بينما يمكن للخدمة تحسين التوجيه والتشغيل وضوابط الأمان والرصد خلفها.

ليس المقصود الغموض لذاته. نشر endpoints التشغيلية أو تفاصيل التوجيه الخاصة لا يجعل تكامل العميل أكثر قابلية لإعادة الإنتاج، بل يضعف حد الخدمة. مكان القابلية لإعادة الإنتاج هو أثر التقييم: prompts وdatasets وإعدادات ومقاييس ونتائج مجمعة ذات إصدارات.

## التقييم الواقعي

الأرقام العامة مفيدة كمؤشر، لكنها لا تمثل دائماً جلسة عمل حقيقية. لذلك يجب أن تشمل اختبارات مبيان عينات محجوزة من مهام عربية واقعية: تقارير، خطط، استخراج، إعادة صياغة ثنائية اللغة، حسابات، ومهام متعددة الخطوات.

يجب تشغيل نفس الـharness على مبيان ونماذج Frontier المختارة، مع تسجيل إصدار النموذج والبيانات والـprompt وحجم العينة وإعدادات التوليد والأدوات وطريقة التقييم وأنواع الإخفاق.

<img src="https://mintcdn.com/nuqtaai/NMqn_brmqKYpilnA/images/mibyan-benchmark-framework.svg?fit=max&auto=format&n=NMqn_brmqKYpilnA&q=85&s=5699a5a871d44bb4e4c5a5b87f31120e" alt="إطار اختبارات مبيان" width="1200" height="620" data-path="images/mibyan-benchmark-framework.svg" />

<Note>الرسم يوضح هيكل التقييم وليس نتائج رقمية منشورة. تُضاف النتائج إلى [صفحة Benchmark](/ar/models/benchmarks) بعد اكتمال الاختبار وإمكانية إعادة إنتاجه.</Note>

## الأداء والتكلفة

يجب عرض الجودة مع زمن أول رمز، والزمن الكلي، واستقرار البث، ومعدل الأخطاء، واستهلاك الرموز، والتكلفة لكل مخرج مقبول. وفي مهام الوكلاء نضيف عدد الخطوات ونجاح استدعاءات الأدوات ومعدل التعافي ووقت الإنجاز.

المقارنة المفيدة هي مقارنة الجودة مقابل الزمن والتكلفة في المهام التي ينفذها المستخدمون فعلياً. قد يتفوق Frontier Model في الاتساع، بينما يكون مبيان أنسب للعمل العربي المهني أو التكامل المنضبط عبر API.

للمعالجة الهندسية لهذه المفاضلة، راجع [التشغيل الكفء](/ar/models/efficient-serving). لا معنى لبصمة خفيفة ما لم يذكر معها الحمل والتزامن والجودة والاعتمادية.

## السلامة والاستخدام المسؤول

صُمم مبيان لمساندة الأشخاص والتطبيقات، لا لاستبدال الضوابط في القرارات المؤثرة. ينبغي لفرق المنتج استخدامه ضمن نظام لديه صلاحيات محددة ومعرفات طلبات وحدود للمعدلات والميزانية والتحقق من المخرجات المنظمة ومسار تصعيد للعمل غير اليقيني أو عالي الأثر.

| الخطر                   | التخفيف في المنتج                                                                          |
| ----------------------- | ------------------------------------------------------------------------------------------ |
| معلومات مختلقة أو قديمة | أسند المهمة إلى مواد موثوقة واطلب مصادر أو تحققاً                                          |
| قيد مفقود               | تحقق من الحقول والصيغ وقواعد العمل المطلوبة داخل التطبيق                                   |
| إساءة استخدام الأدوات   | اجعل الصلاحيات والموافقات داخل التطبيق وتعامل مع مخرج الأداة كبيانات غير موثوقة حتى التحقق |
| قرارات حساسة            | اشترط المراجعة البشرية واحتفظ بأثر تدقيق                                                   |
| عدم استقرار تشغيلي      | استخدم timeouts وإعادات بتراجع وidempotency عند الحاجة ومعرفات طلبات                       |

## الاستخدام الإنتاجي

استخدم المعرف العام `mibyan-4.1` عبر API متوافق مع OpenAI.

## الحدود

قد يهلوس مبيان أو يسيء فهم الطلب أو يفوّت قيداً أو ينتج إجابة فصيحة لكنها غير صحيحة. لا تستخدم Benchmark العام بديلاً عن تقييم مجالك أو المصادر الموثوقة أو الموافقة البشرية في المهام الحساسة.
