الملخص التنفيذي
يبدأ مبيان من أساس K2.6 ثم يُهيأ للعمل المهني العربي. ويركز العمل على ملاءمة اللغة وحفظ القيود والمخرجات المنظمة والسياقات ثنائية اللغة وحد خدمة متحكم فيه. نقيم الناتج كنظام: الجودة وزمن الاستجابة والاعتمادية وقابلية التعافي تُقرأ معاً. نميز عمداً بين ما ننشره وما هو حساس تشغيلياً. يشرح التقرير السلوك والمنهج، ولا ينشر بيانات العملاء الخاصة أو بيانات الاعتماد أو المضيفات الداخلية أو إعدادات التوجيه الحية.التدريب الإضافي وFine-tuning
يُطوّر مبيان مع تركيز على العربية والعمل العملي: العربية الفصحى، المصطلحات الخليجية، المزج بين العربية والإنجليزية، الكتابة المهنية، المخرجات المنظمة، واتباع التعليمات. الهدف ليس جعل النص العربي فصيحاً فقط، بل تحسين السلوك الكامل: فهم الطلب الناقص، الحفاظ على القيود، اختيار هيكل مفيد، وإنتاج مخرج يمكن مراجعته وتحريره.مبادئ التهيئة
حد النموذج والنظام
يظهر النموذج عبر المعرف العام المستقرmibyan-4.1 وعقد متوافق مع OpenAI. هذا الحد متعمد: تتكامل التطبيقات مع واجهة ثابتة، بينما يمكن للخدمة تحسين التوجيه والتشغيل وضوابط الأمان والرصد خلفها.
ليس المقصود الغموض لذاته. نشر endpoints التشغيلية أو تفاصيل التوجيه الخاصة لا يجعل تكامل العميل أكثر قابلية لإعادة الإنتاج، بل يضعف حد الخدمة. مكان القابلية لإعادة الإنتاج هو أثر التقييم: prompts وdatasets وإعدادات ومقاييس ونتائج مجمعة ذات إصدارات.
التقييم الواقعي
الأرقام العامة مفيدة كمؤشر، لكنها لا تمثل دائماً جلسة عمل حقيقية. لذلك يجب أن تشمل اختبارات مبيان عينات محجوزة من مهام عربية واقعية: تقارير، خطط، استخراج، إعادة صياغة ثنائية اللغة، حسابات، ومهام متعددة الخطوات. يجب تشغيل نفس الـharness على مبيان ونماذج Frontier المختارة، مع تسجيل إصدار النموذج والبيانات والـprompt وحجم العينة وإعدادات التوليد والأدوات وطريقة التقييم وأنواع الإخفاق.الرسم يوضح هيكل التقييم وليس نتائج رقمية منشورة. تُضاف النتائج إلى صفحة Benchmark بعد اكتمال الاختبار وإمكانية إعادة إنتاجه.
الأداء والتكلفة
يجب عرض الجودة مع زمن أول رمز، والزمن الكلي، واستقرار البث، ومعدل الأخطاء، واستهلاك الرموز، والتكلفة لكل مخرج مقبول. وفي مهام الوكلاء نضيف عدد الخطوات ونجاح استدعاءات الأدوات ومعدل التعافي ووقت الإنجاز. المقارنة المفيدة هي مقارنة الجودة مقابل الزمن والتكلفة في المهام التي ينفذها المستخدمون فعلياً. قد يتفوق Frontier Model في الاتساع، بينما يكون مبيان أنسب للعمل العربي المهني أو التكامل المنضبط عبر API. للمعالجة الهندسية لهذه المفاضلة، راجع التشغيل الكفء. لا معنى لبصمة خفيفة ما لم يذكر معها الحمل والتزامن والجودة والاعتمادية.السلامة والاستخدام المسؤول
صُمم مبيان لمساندة الأشخاص والتطبيقات، لا لاستبدال الضوابط في القرارات المؤثرة. ينبغي لفرق المنتج استخدامه ضمن نظام لديه صلاحيات محددة ومعرفات طلبات وحدود للمعدلات والميزانية والتحقق من المخرجات المنظمة ومسار تصعيد للعمل غير اليقيني أو عالي الأثر.الاستخدام الإنتاجي
استخدم المعرف العامmibyan-4.1 عبر API متوافق مع OpenAI.