خدمة · المواءمة وRLHF

التعلم المعزز من ملاحظات البشر (RLHF) للنماذج العربية

بيانات تفضيل، ودرجات معايير، وإعادة كتابة، وبيانات نموذج مكافأة لنماذج اللغة العربية الكبيرة. يصدر كل حكم عن مقيّم أصلي يطابق اللهجة والمجال المستهدفين، ويُعايَر على عينات ذهبية.

التعلم المعزز من ملاحظات البشر (Reinforcement Learning from Human Feedback – RLHF) هو المرحلة التي يقارن فيها مقيّمون بشريون إجابات النموذج ويقيّمونها ويعيدون كتابتها، ليتعلّم نموذج المكافأة (Reward Model) أو خوارزمية مثل DPO معنى «الإجابة العربية الجيدة». تزوّد Bayanat Labs من الرياض فرقَ النماذج العربية بهذه البيانات: ترتيب الإجابات، ودرجات المعايير، وإعادة الكتابة، وبيانات نموذج المكافأة، وإشارات السلامة، من مقيّمين أصليين يطابقون لهجتك ومجالك. وتختلف هذه الخدمة عن توسيم البيانات وتصنيفها بالمعنى التقليدي.

النموذج يُواءَم مع من قيّموه. ذكر فريق InstructGPT أن مقيّميه كانوا غالبًا ناطقين بالإنجليزية في الولايات المتحدة وجنوب شرق آسيا. والعربية تضيف أسئلة لا يحسمها هؤلاء: فصحى أم لهجة؟ وأي لهجة؟ وهل تناسب الإجابة ثقافة المستخدم؟ ويخلص فريق ALLaM إلى أن المواءمة الموسّعة مع التفضيلات البشرية قد ترفع أداء النموذج مقارنةً بنماذج أكبر حجمًا لكن مواءمتها أقل جودة.

ماذا نسلّم في مشاريع RLHF بالعربية؟

ترتيب إجابات النماذج

اختيار الأفضل بين إجابتين أو أكثر، مع قوة التفضيل ورموز الأسباب. هذه بيانات التفضيل (Preference Data) الأساسية لـ DPO ونماذج المكافأة.

التقييم وفق المعايير

درجات مستقلة (Rubric Scores) للدقة ومستوى الخطاب واللهجة والملاءمة الثقافية والسلامة، تدرّب نماذج مكافأة انحدارية وتكشف مواضع الضعف.

إعادة الكتابة وبيانات SFT

تحويل الإجابات المرفوضة إلى إجابات مرجعية بالمتغير المستهدف، بأقلام محررين ولغويين أصليين.

بيانات نموذج المكافأة

أزواج متوازنة، وأمثلة سلبية صعبة تختلف في معيار واحد، ووسوم للتعادل و«كلتاهما غير مقبولة»، ومجموعة محجوزة لاختبار النموذج نفسه.

السلامة والاختبار العدائي

موجّهات عدائية باللهجات (Red-teaming)، وأحكام على الرفض المستحق والرفض المفرط.

ملاحظات خبراء المجال

أطباء ومحامون ومصرفيون ومهندسون مرخّصون يراجعون الدقة في تخصصاتهم.

ما معايير الإجابة العربية الجيدة؟

المعايير العامة («مفيد وغير ضار») تغفل ما يلاحظه المستخدم العربي أولًا؛ فالعرب لا يتشاركون ثقافة واحدة، والنماذج تميل إلى الكيانات الغربية حتى في السياق العربي. لذا نمنح كل بُعد درجة من 0 إلى 4 قبل التفضيل العام. الجدول توضيحي.

المعيارما يتحقق منه المقيّمخطأ عربي شائع
مستوى الخطاب (Register)الرسمية تطابق سياسة المنتجفصحى متكلفة في رد على سؤال عابر
مطابقة اللهجةالبقاء في المتغير المطلوب«عايز» المصرية بدل «أبغى» في رد خليجي
الملاءمة الثقافيةالمراجع والألقاب والتواريختاريخ ميلادي حيث يُتوقع الهجري
سلامة اللغةالنحو والإملاء وطبيعية التعبيرترجمة حرفية: «آمل أن تجدك هذه الرسالة بخير»
السلامةاتباع السياسة في الاتجاهينرفض سؤال طبي بريء، أو تمرير طلب ضار باللهجة

مثال تطبيقي: موجّه واحد وإجابتان

الموجّه (لهجة سعودية): «اكتب لي رسالة قصيرة لمديري، أبي إجازة يومين الأسبوع الجاي عشان ظرف عائلي.»

الإجابة (أ)، وتقع في ثلاث فقرات: «عزيزي المدير، آمل أن تجدك هذه الرسالة بخير… ولا تتردد في التواصل معي إذا كانت لديك أي أسئلة.»

الإجابة (ب): «السلام عليكم أستاذ [الاسم]، أرجو التكرم بالموافقة على إجازة يومين ([التاريخ]) لظرف عائلي، وسأسلّم مهامي العاجلة قبلها. شاكر لك.»

تفوز (ب): قصيرة كما طُلب، بصيغة المراسلات الرسمية المألوفة في بيئة العمل السعودية، ولا تخترع تاريخًا. أما (أ) فمهذبة، لكن عباراتها منقولة عن قوالب البريد الإنجليزي، وطولها يغري المقيّم غير المتمرّس، ونماذج المكافأة تتأثر بالطول أصلًا. ولاحظ أن (ب) فصحى والموجّه عامي؛ فمخاطبة المدير تستدعي الرسمية، ومن يطبّق «رُدّ بلهجة المستخدم» آليًا سيعاقبها. لذا نكتب سياسة مستوى الخطاب في المعايير، ويسجّل المقيّم رموز الأسباب (ترجمة حرفية، إطالة) لتدقيق كل حكم.

من يقيّم؟ مقيّمون أصليون مطابقون للهجة وخبراء مجال

نغطي أكثر من 25 لهجة ومتغيرًا عربيًا، منها الفصحى والخليجية والمصرية والشامية والعراقية والمغاربية، ونطابق المقيّم مع لهجة الموجّه ولهجة الرد؛ فلا يحكم مقيّم شامي على الخطاب النجدي. يجتاز المقيّمون فحص اللهجة والمجال قبل رؤية بيانات العميل، ويتأهلون على أزواج ذهبية محكّمة تبقى مدسوسة في العمل لكشف الانحراف مبكرًا. ويشمل ذلك المخرجات الصوتية؛ انظر جمع البيانات الصوتية العربية.

كيف يسير مشروع التعلم المعزز من ملاحظات البشر؟

  1. تحديد النطاق (Vet). اللهجات، وسياستا مستوى الخطاب والسلامة، والمجالات، وطريقة التدريب: DPO أو نموذج مكافأة أو تعلم معزز تفاعلي (Online RL).
  2. المعايير والعينة الذهبية (Train). دليل معايير نكتبه مع فريقك، وأزواج ذهبية محكّمة يتأهل عليها المقيّمون.
  3. التجربة (Produce). دفعة محددة من مخرجات نموذجك، مع تحليل الاتفاق ودقة العينات الذهبية ومواضع الخلاف.
  4. ضبط الجودة والتحكيم (QA). تقييم مزدوج لعينة من العناصر، وتحكيم لغوي للخلافات، وإعادة ما يخفق في الفحوص.
  5. التوسّع والتسليم (Deliver). إصدارات مرقّمة (JSONL أو Parquet) بصيغ Hugging Face TRL مثل prompt, chosen, rejected أو بمخططك، مع لهجة المقيّم وإصدار المعايير وسجل تدقيق لكل مهمة.

كيف نقيس الجودة والاتفاق بين المقيّمين؟

لكل وسم مقياس اتفاق (Inter-Annotator Agreement) يناسبه: كابا (Cohen أو Fleiss) للاختيارات الزوجية، وألفا كريبندورف (Krippendorff's alpha) للدرجات الترتيبية، مع دقة كل مقيّم على العينات الذهبية. ونفرّق بين خطأ في تطبيق المعايير يُحكَّم ويُعاد العمل عليه، وخلاف مشروع، كاختلاف مقيّم خليجي وآخر شامي فيما يُعدّ مهذبًا، نحتفظ فيه بالحكمين موسومين بلهجة كل منهما؛ لأن المتوسط يواءم النموذج بصمت مع مجتمع واحد.

نصيحة للمشتري: بلغ الاتفاق بين مقيّمي التدريب في InstructGPT نحو 73% فقط، فإذا رأيت اتفاقًا شبه تام على موجّهات عربية مفتوحة، فقد يعني ذلك أن المقيّمين يحكمون على الطول أو الرسمية لا على الجودة.

متى نؤتمت التقييم ومتى نحتاج مقيّمين بشريين؟

النماذج تصلح لتوليد الإجابات المرشحة وفرزها أوليًا، لا للحكم العربي النهائي. في تدقيق LabelBench سجّل نموذج Qwen 2.5 3B دون أمثلة تدريبية (Zero-shot) نسبة 78% في تصنيف السمّية العربية الثنائي، ثم هبط إلى 25.3% على التصنيف الفعلي ذي الوسوم السبعة، وإلى 22.4% في تمييز خمس مناطق لهجية، قرب مستوى التخمين (20%)؛ إذ وسم 75% من الأمثلة الخليجية بأنها مصرية. وحتى Fanar 1 9B المتخصص بالعربية لم يتجاوز 47.8% في تمييز اللهجات. والمُحكِّم الذي لا يميّز اللهجات لا يستطيع الحكم على مطابقتها. وفي السلامة وجد معيار ASAS المنسّق بشريًا أن أداء المُحكِّمات الآلية مثل GPT-4o ضعيف مقارنةً بالمقيّمين البشريين.

لذا لا يخرج حكم من المراجعة البشرية إلا حين تُثبت «تغطية الأتمتة الآمنة» (Safe Automation Coverage)، مقيسةً على بياناتك، أن ذلك آمن. وإن اعتمدت على ملاحظات الذكاء الاصطناعي (RLAIF)، فأبقِ شريحة بشرية لتدقيقها.

الأمن وإقامة البيانات

ولأن سجلات المحادثات تحوي غالبًا بيانات عملاء، تُستضاف البيانات داخل المنطقة افتراضيًا، مع خيار التشغيل في مقرّك (On-prem) أو في سحابة خاصة، ويعمل المقيّمون بموجب اتفاقيات عدم إفصاح (NDA) وبأقل صلاحيات لازمة، مع سجل تدقيق لكل مهمة. راجع قائمة التحقق من نظام حماية البيانات الشخصية (PDPL) (بالإنجليزية) وصفحة توسيم البيانات في السعودية.

حالات الاستخدام حسب القطاع

البنوك: إجابات باللهجة ضمن سياسة الاستشارة. الصحة: دقة يقيّمها أطباء. الحكومة: ردود رسمية على أسئلة عامية. القانون: مراجعة محامين. الاتصالات والإعلام والتجزئة: نبرة خدمة العملاء وصوت العلامة.

فريق داخلي أم منصة جماعية أم مزوّد متخصص؟

فريق داخليمنصة جماعيةمزوّد عربي متخصص
مطابقة اللهجةبحسب التوظيفإفادة ذاتية غالبًافحص لكل متغير
المعايير والعينات الذهبيةعليك بناؤهاعليك غالبًاتُكتب معك
التحكيممن وقت مراجعيكتصويت الأغلبية غالبًاجزء من سير العمل
إقامة البياناتتحكم كاملقوى عاملة عالمية غالبًاداخل المنطقة افتراضيًا

واسأل أي خيار عن لهجة كل مقيّم واتفاقه ودقته على العينات الذهبية ومكان عمله، ثم قِس أثر البيانات عبر تقييم مستقل لنماذج اللغة العربية.

ابدأ بتجربة محددة النطاق

تجربة على مخرجات نموذجك: دليل معايير نكتبه معًا، وضبط جودة بالعينات الذهبية، وتقرير عن الاتفاق وأنماط الخلاف، وعادةً خلال أسبوعين. بعدها نتوسع بصيغة مُدارة أو مدمجة مع فريقك أو مؤسسية. وللمزيد: مقالاتنا بالعربية ودليل توسيم البيانات العربية.

أسئلة شائعة

ما الفرق بين RLHF وDPO؟ وهل نحتاج إلى نموذج مكافأة؟

في RLHF الكلاسيكي يُدرَّب نموذج مكافأة على بيانات التفضيل، ثم يُحسَّن النموذج بالتعلم المعزز (مثل PPO). أما DPO فيحلّ المسألة نفسها بدالة خسارة تصنيفية بسيطة دون نموذج مكافأة منفصل. وكلتاهما تتعلم من أزواج «مختارة ومرفوضة»، فتصلح بياناتنا لهما، ونضيف مجموعة محجوزة لاختبار نموذج المكافأة إن اخترته.

هل تكفي ترجمة بيانات التفضيل الإنجليزية إلى العربية؟

الترجمة تفيد في توليد الموجّهات الأولية، لكنها لا تمنحك تفضيلات عربية؛ فالزوج المترجم يحمل أعراف مقيّميه الأصليين، وقد يتعلم نموذج المكافأة تفضيل الصياغة المترجمة نفسها. إن بدأت ببيانات مترجمة، فليُعِد مقيّمون أصليون ترتيبها وكتابتها بالمتغير المستهدف، ثم اختبرها على مجموعة تقييم كُتبت بالعربية أصلًا.

كم زوجًا من بيانات التفضيل العربية نحتاج؟

لا رقم واحد يناسب كل مشروع؛ فالحجم يتوقف على طريقة التدريب، وحجم الفجوة في سلوك النموذج، واتساق المقيّمين. حدّده بالقياس: درّب على مجموعات فرعية متزايدة، واستمر ما دامت نتائج التقييم تتحسن. فإصلاح محدود كالنبرة في مجال واحد يحتاج بيانات أقل بكثير من نموذج مكافأة عام.

هل تقيّمون مخرجات نموذجنا أم تكتبون الإجابات بأنفسكم؟

كلاهما. أنفع إشارة تأتي عادةً من تقييم عينات من نموذجك الحالي، لأنها السلوك الذي تريد تغييره. ويمكننا أيضًا كتابة موجّهات باللهجة المستهدفة، وإنتاج إجابات مرجعية، وترتيب إجابات مرشحة من عدة نماذج. ونحن محايدون تجاه النماذج (Model-agnostic): نعمل على البيانات فقط ولا ننافس نماذج عملائنا.

خطّط لتجربة RLHF عربية

أخبرنا بلهجاتك المستهدفة ومجالك وطريقة التدريب. نعود إليك بتجربة محددة النطاق على مخرجات نموذجك، تشمل ضبط الجودة بالعينات الذهبية وتقريرًا عن الجودة، وعادةً خلال أسبوعين.

تواصل معنا