خدمة · تقييم النماذج

خدمات تقييم نماذج اللغة العربية: تقييم بشري مستقل لكل لهجة

لفرق تختار نموذجاً عربياً أو تضبطه أو تطلقه لعملائها: مقيّمون أصليون لكل لهجة، ومجموعات اختبار خاصة لا تُنشر، وفحص لحالة النظام عند تقييم الوكلاء، وتقرير مفصّل تستند إليه لجنة القرار.

تقدّم Bayanat Labs خدمات تقييم نماذج اللغة العربية (Arabic LLM evaluation): تقييم بشري مستقل ومعمّى (Blind) للنماذج اللغوية الكبيرة ووكلاء الذكاء الاصطناعي، يجريه متحدثون أصليون موثَّقون لكل لهجة ومختصون مرخَّصون. الخدمة لفرق الذكاء الاصطناعي في البنوك والجهات الحكومية والاتصالات ولدى مطوّري النماذج، ممن يحتاجون جواباً قبل الإطلاق: هل النموذج جاهز لعملائنا بلهجاتهم؟ تحصل على نتائج لكل لهجة ولكل بُعد مع الأحكام الخام. ولأننا نعمل في البيانات فقط ولا نبني نماذج، فلا مصلحة لنا في ترجيح نموذج على آخر.

25+لهجة وتنويعة عربية
5أبعاد يُقاس كلٌّ منها على حدة
أسبوعانالمدة المعتادة للمشروع التجريبي

ماذا تشمل خدمة تقييم النماذج اللغوية الكبيرة؟

اختيار النموذج

مقارنة معمّاة بين النماذج المرشحة، مغلقة أو مفتوحة الأوزان، على طلبات من حالة استخدامك.

مجموعات اختبار خاصة

طلبات تُكتب أصلاً بكل لهجة، بسلالم تقييم (Rubrics) وإجابات مرجعية. لا تُنشر، فلا تتسرّب إلى بيانات التدريب.

اختبار الانحدار

مجموعة ثابتة تُعاد على كل نسخة مضبوطة، حتى لا يُخفي تحسّنٌ في الفصحى تراجعاً في الخليجية.

التفضيل والتصحيح بالسلالم

مقارنات زوجية (Pairwise preference) ودرجات ووسوم أخطاء، من مقيّمين يتحدثون اللهجة المقيَّمة.

السلامة والمواءمة الثقافية

الحساسية الدينية والاجتماعية والرفض المفرط (Over-refusal). أما الاختبارات العدائية فضمن خدمة الفريق الأحمر للذكاء الاصطناعي العربي.

تقييم الوكلاء

فحص استدعاءات الأدوات والحالة النهائية للنظام، لا ما يدّعيه الرد (منهجية تجريبية).

الأبعاد الخمسة لتقييم نماذج اللغة العربية

نُبلغ عن كل بُعد منفصلاً لكل لهجة ومجال، ولا ندمجها في «درجة عربية» واحدة تُخفي مواطن الضعف.

البُعدما نفحصهمثال اختبار (توضيحي)
فهم اللهجةاللهجات والتبديل اللغوي (Code-switching) والعربيزي (Arabizi)«أبي أأجّل موعدي» (خليجية)، «عايز أأجّل الميعاد» (مصرية)، «بغيت نأجّل الموعد» (مغربية)، وبالعربيزي abi a2ajjil maw3di. من يقرأ الخليجية بعين الفصحى يفهم «أبي» بمعنى «والدي» لا «أريد».
سجلّ التوليداللهجة ومستوى الرسمية اللذان يحددهما دليل الأسلوب، دون ركاكة الترجمةسؤال بالعامية يشترط دليل الأسلوب الرد بها؛ والنماذج تفهم اللهجة أفضل مما تكتبها، إذ تميل إلى الرد بالفصحى (AL-QASIDA).
الدقة الإقليميةالجهات والأنظمة والأماكن المحلية«من يشرف على حماية البيانات الشخصية في المملكة؟» الجواب: سدايا.
المواءمة الثقافية والسلامةمراعاة الأعراف، والرفض المفرط أو المتساهلسؤال مشروع عن أحكام الزكاة يُجاب ولا يُرفض.
مهام المجالمهامك الفعلية بحكم مختصين مرخّصينطبيب يقيّم ردّاً على أعراض وصفها مريض بالعامية النجدية.

هل تكفي معايير تقييم النماذج العربية المنشورة لقرار الإطلاق؟

لوحات الصدارة (Leaderboards) والمعايير المرجعية (Benchmarks) تصلح لتضييق القائمة، لا لإجازة الإطلاق:

  • الترجمة تترك أثرها. في النسخة الثانية من Open Arabic LLM Leaderboard (فبراير 2025) حُذفت المهام المترجمة آلياً لتدنّي جودتها واحتمال انحيازها الثقافي. فالسؤال المترجم عن القانون الأمريكي يقيس معرفة أمريكية بحروف عربية.
  • معظمها اختيار من متعدد، بينما يحكم عميلك على ما يكتبه النموذج فعلاً.
  • اللهجات نادراً ما تُفصل، وحين تُفصل تنخفض الدرجات. في DialectalArabicMMLU بلغ متوسط دقة 19 نموذجاً مفتوح الأوزان (1B–13B) على خمس لهجات 47.7%، مقابل 51.9% بالفصحى و62.8% بالإنجليزية، و48.2% على اللهجة السعودية.
  • البنود العامة قد تتسرّب إلى بيانات التدريب، ولا تعكس مجالك ولا لهجات عملائك. (عن أشهر المعايير: ArabicMMLU وOALL وBALSAM، بالإنجليزية.)

كيف يسير مشروع تقييم النموذج؟

المراحل تتبع منهجيتنا: الفحص ← التدريب ← الإنتاج ← ضبط الجودة ← التسليم.

  1. تحديد القرار والنطاق. اختيار أم إطلاق أم انحدار؛ اللهجات وحصة كل منها؛ المجالات وعتبات النجاح. ويجتاز المقيّمون فحص اللهجة والمجال قبل رؤية بياناتك.
  2. السلالم والمجموعة الذهبية. طلبات تُكتب أصلاً بكل لهجة ولا تُترجم من الإنجليزية، ومعايرة للمقيّمين على بنود مصحّحة سلفاً (Gold set).
  3. تجربة على شريحة صغيرة. لاختبار وضوح السلّم ومستوى الاتفاق، وإعادة صياغة البنود الملتبسة قبل التوسع.
  4. التحكيم وضبط الجودة. هويات النماذج مخفية وترتيب الإجابات عشوائي، وبنود ذهبية مدسوسة لرصد الانجراف، وشريحة مشتركة يقيّمها أكثر من مقيّم.
  5. التقرير والتسليم. ملف لكل لهجة، وتصنيف للأخطاء بأمثلة عربية، والأحكام الخام، ومجموعة مجمّدة لاختبار النسخة التالية.

كيف نضمن موثوقية التقييم البشري للنماذج؟

نقيس الاتفاق بين المقيّمين (Inter-annotator agreement) على الشريحة المشتركة لكل بُعد ولهجة ونعرضه مع النتائج؛ وانخفاضه يستدعي إصلاح السلّم قبل الحكم على النموذج. تُحسم الخلافات بالفصل (Adjudication)، ويُعاد العمل المرفوض، ولكل حكم سجل تدقيق. والعرض المعمّى بترتيب عشوائي يحدّ من انحياز الموضع الذي وثّقته دراسة Zheng وزملائه (2023) مع انحياز الإسهاب لدى المحكّمات الآلية. والإطار العام لضبط الجودة في دليل توسيم البيانات العربية.

متى تكفي الأتمتة، ومتى تحتاج مقيّمين من أهل اللهجة؟

القاعدة: أتمت ما يمكن التحقق منه، واحتفظ بالبشر حيث يكون الحكم هو القياس نفسه.

نوع الفحصالأنسبالسبب
الاختيار من متعدد وصيغة المخرجاتآليالصواب قابل للمطابقة
استدعاءات الأدوات والحالة النهائيةآلي مع مراجعة عيّنةالحالة تُقرأ من النظام مباشرة
الالتزام باللهجة والسجل اللغويمقيّم من أهل اللهجةلا يقيسه إلا من يتكلمها
الملاءمة الثقافية والدينيةمقيّم أصلياستدلال ضمني لا مطابقة ألفاظ
الصحة الطبية أو القانونية أو الماليةمختص مرخّصالخطأ مكلف ولا يكشفه غير المختص

في دراسة منشورة عام 2026 قورنت خمسة محكّمات آلية (LLM-as-a-judge) بأحكام خبراء مختصين من أهل اللغة على طلبات باللهجتين المصرية والعراقية، فجاءت أربعة منها متساهلة منهجياً، وكان الاستدلال الثقافي الضمني نقطة الإخفاق الرئيسية (Abdoli وزملاؤه). وفي تدقيقنا LabelBench هبط نموذج من 78% في تصنيف السمّية العربية بنعم أو لا إلى 25.3% على التصنيف الحقيقي متعدد الوسوم، و22.4% عبر خمس مناطق لهجية. الحل هجين: عايِر المحكّم الآلي على شريحة قيّمها بشر، ووجّه الخلافات إلى المقيّمين، وقِس ما يغادر الطابور البشري بأمان بمقياس Safe Automation Coverage.

تقييم الوكلاء بالعربية: افحص الحالة لا الجملة

الرد السلس لا يعني أن المعاملة اكتملت. نحكم على سجل الأدوات والحالة النهائية للنظام مقابل هدف معلن، كما يقارن τ-bench حالة قاعدة البيانات في نهاية المحادثة بالحالة المستهدفة. وتنخفض دقة استدعاء الأدوات بنسبة تتراوح بين 5% و10% في المتوسط حين يتفاعل المستخدم بالعربية، أيّاً كانت لغة وصف الأدوات (Kubrak وزملاؤه، 2026).

في مختبر موثوقية الوكلاء بالعربية (منهجية تجريبية) أكّد وكيلٌ للمستخدم أنه ألغى الطلب بنجاح، مع أنه لم يستدعِ سوى get_order، وبقيت حالة الطلب packed دون تغيير. ولنظام محلي واحد مُفصح عن إعداداته، يعمل بأقل الصلاحيات، بلغ الإنجاز التشغيلي 15 من 21 عائلة سير عمل اصطناعية، وجودة التواصل 5 من 21، فنُبلغ عنهما منفصلين. هذه نتائج تطويرية على حزمة اصطناعية مفتوحة، لا درجات دقة ولا ترتيب ولا شهادة. والتدقيق الخاص يطبّق المنهجية على مسارات عملك وأدواتك بتجارب متكررة.

التغطية والأمن وحالات الاستخدام

يغطي مقيّمونا أكثر من 25 لهجة وتنويعة عربية، من الفصحى إلى الخليجية والمصرية والشامية والعراقية والمغاربية، ويتولى الحكم على مهام المجال أطباء ومحامون ومصرفيون ومهندسون ومحررون. والبروتوكول نفسه يشمل تقييم التفريغ الصوتي والتعرف الضوئي على النص العربي (OCR) وفهم المستندات.

تُستضاف البيانات داخل المنطقة افتراضياً، مع خيارَي التشغيل داخل مقرّك (On-prem) أو في سحابتك الخاصة، ووصول بأقل الصلاحيات، وسجلات تدقيق، ومساهمين ملتزمين باتفاقيات عدم إفصاح (NDA). راجع نظام حماية البيانات الشخصية وإقامة البيانات (بالإنجليزية)، وللمشاريع داخل المملكة خدماتنا لتوسيم البيانات في السعودية.

  • البنوك والتمويل: إجازة مساعد خدمة عملاء يخاطبه العملاء بالعامية، بمراجعة مصرفيين.
  • الرعاية الصحية: تقييم ردود الفرز الأولي وملخصات الملفات على يد أطباء.
  • الحكومة والقطاع العام: اختيار نموذج لخدمات المستفيدين يعرف الإجراءات المحلية.
  • القانون: تلخيص العقود والإجابة عن الأسئلة النظامية بحكم محامين.
  • الاتصالات والإعلام والتجزئة: اختبار انحدار المساعدات عبر لهجات السوق.

فريق داخلي أم منصة تعهيد جماعي أم شريك متخصص؟

السؤالفريق داخليمنصة تعهيد جماعيشريك متخصص
مقيّمون أصليون لكل لهجة؟لهجات موظفيك فقطغالباً بالتصريح الذاتييُفحصون لكل لهجة
مستقل عن النموذج؟تقيّم عملك بنفسكنعمنعم، إن لم يكن يبني نماذج
سلالم واتفاق وفصل في الخلافات؟تبنيها بنفسكتبنيها بنفسكجزء من الخدمة
أين تُعالَج البيانات؟تحت سيطرتكحيث يوجد العاملوناسأل؛ لدينا داخل المنطقة افتراضياً

ابدأ بمشروع تجريبي

المشروع التجريبي محدد النطاق: قرار واحد، ولهجتان أو ثلاث، ومجال واحد. يشمل ضبط الجودة بمجموعة ذهبية وتقرير جودة، ويُسلَّم عادةً خلال أسبوعين، ثم تتوسع بصيغة مُدارة أو مدمجة مع فريقك أو مؤسسية. وإن كشف التقييم فجوات، نسدّها ببيانات التعلم المعزز من ملاحظات البشر (RLHF) أو توسيم البيانات العربية. أخبرنا بالقرار الذي تحتاج اتخاذه، أو تصفّح مقالاتنا بالعربية.

أسئلة شائعة

كم تبلغ تكلفة تقييم نماذج اللغة العربية؟

لا ننشر قائمة أسعار؛ نسعّر بعد تحديد النطاق. تتحدد التكلفة بعدد اللهجات، وعدد الطلبات لكل لهجة، وعدد المقيّمين لكل بند، وهل يلزم محكّمون مرخّصون كالأطباء والمحامين؛ ويضيف تقييم الوكلاء إعداد بيئة اختبار معزولة. والمشروع التجريبي يمنحك تقرير جودة وأساساً لتقدير كلفة التوسع، ويُسلَّم عادةً خلال أسبوعين.

كم طلباً يحتاج تقييم نموذج لغوي عربي؟

ما يكفي لكل خلية قرار (لهجة × بُعد) حتى يضيق هامش الثقة عن الفرق الذي يهمك. مثال توضيحي: 200 بند بنسبة نجاح 70% تعطي فاصل ثقة 95% يقارب ±6 نقاط، بينما 50 بنداً تعطي نحو ±13 نقطة. احسب الحجم لكل لهجة لا للمجموع، وإلا حسمت عينةٌ شامية هزيلة قرار إطلاقك في بلاد الشام.

هل يمكنكم تقييم نموذج لم نبنه، أو واجهة برمجة لمزوّد آخر؟

نعم. نعمل في البيانات فقط ولا نبني نماذج، فلا نموذج لنا نحابيه. نقارن الواجهات المغلقة والنماذج مفتوحة الأوزان ونسخك المضبوطة جنباً إلى جنب، مع إخفاء هوياتها عن المقيّمين. ويمكن تقييم نقاط الاتصال الخاصة داخل مقرّك أو في سحابتك الخاصة بدلاً من تصدير المخرجات.

ما الفرق بين تقييم النماذج واختبارات الفريق الأحمر (Red teaming)؟

التقييم يقيس أداء النموذج على الاستخدام المتوقع: طلبات ممثِّلة تُصحَّح وفق سلالم مكتوبة وتُعرض نتائجها نسباً. أما الفريق الأحمر فيبحث عن أسوأ الحالات، كمحاولات كسر القيود باللهجة أو بالعربيزي، أو استدراج نصيحة طبية ضارة، ويرتّب ما يجده حسب الخطورة. ومعظم عمليات الإطلاق تحتاج الاثنين.

صمّم مشروعاً تجريبياً للتقييم

أخبرنا بالقرار الذي تحتاج اتخاذه، والنماذج المرشحة، واللهجات المستهدفة، والمجال. نعود إليك بمشروع تجريبي محدد النطاق، مع ضبط جودة بمجموعة ذهبية وتقرير جودة، عادةً خلال أسبوعين.

ابدأ التقييم