دليل · المواءمة وRLHF

بيانات RLHF العربية: كيف تُجمع بيانات التفضيل من متحدثين أصليين

النموذج يتعلم ذوق من قيّموه. إن قيّمه مترجمون أو مقيّمون لا يعرفون لهجة المستخدم، تعلّم عربية لا يتكلمها أحد. شرح عملي لبيانات التفضيل العربية: ما هي، ولماذا لا تكفي الترجمة، وكيف يُبنى معيار التقييم ويُعايَر المقيّمون.

فريق أبحاث Bayanat Labs· · 11 دقيقة قراءة · Read in English

بيانات RLHF العربية هي أحكام بشرية على إجابات نموذج لغوي بالعربية: يقرأ مقيّم إجابتين للموجّه نفسه، ويختار الأفضل، ويسجّل السبب. ومن هذه الأزواج يتعلم نموذج المكافأة (Reward Model) أو خوارزمية مثل DPO معنى «الإجابة الجيدة». وحتى تكون بيانات تفضيل عربية فعلًا، يجب أن تُكتب الموجّهات بالعربية أصلًا، وأن يحكم عليها متحدثون أصليون يطابقون لهجة المستخدم ومجاله، وفق معيار مكتوب يعرّف الجودة بمقاييس عربية.

ما هي بيانات RLHF وDPO؟

التعلم المعزز من ملاحظات البشر (Reinforcement Learning from Human Feedback – RLHF)، ويُترجَم أيضًا «التعلم المعزز من ردود الفعل البشرية»، يَصقُل إجابات النموذج بعد تدريبه الأساسي. في صيغته التي وصفها فريق InstructGPT، يرتّب مقيّمون بشريون عدة إجابات للموجّه الواحد، ويُدرَّب على مقارناتهم نموذج مكافأة يمنح كل إجابة درجة، ثم يُحسَّن النموذج بالتعلم المعزز ليرفعها.

أما تحسين التفضيل المباشر (Direct Preference Optimization – DPO) فيختصر الطريق: بيّن مؤلفو ورقة DPO أن المسألة نفسها تُحل بدالة خسارة تصنيفية بسيطة، دون نموذج مكافأة منفصل. والطريقتان تتغذيان على المادة نفسها: موجّه، وإجابة مختارة (Chosen)، وأخرى مرفوضة (Rejected). ولبيانات التفضيل البشري أربعة أشكال شائعة:

  • المقارنة الزوجية (Pairwise): أيّ الإجابتين أفضل، وبأي قدر؟ وهي مادة DPO المباشرة.
  • الترتيب (Ranking): ترتيب ثلاث إجابات أو أكثر، ثم تفكيكه إلى أزواج.
  • الدرجات وفق المعايير (Rubric Scores): درجة لكل بُعد تكشف لماذا فازت إجابة.
  • الحكم المنفرد: إجابة واحدة «مقبولة» أو «مرفوضة»، وتسمّيه مكتبة Hugging Face TRL «تفضيلًا غير مزدوج» (Unpaired Preference) وتستخدمه خوارزميات مثل KTO.

وتوصي وثائق TRL لبيانات DPO بحقل مستقل للموجّه (prompt, chosen, rejected). وأضف ما لا تطلبه المكتبة: لهجة الموجّه، ولهجة المقيّم، وقوة التفضيل، ورموز الأسباب، وإصدار المعيار.

لماذا تفشل بيانات التفضيل المترجمة؟

أسرع طريق إلى «بيانات RLHF بالعربية» ترجمة مجموعة إنجليزية جاهزة، لكن الترجمة تنقل الكلمات وتترك أربع مشكلات:

  1. الحكم صدر عن غيرك. تذكر ورقة InstructGPT أن أكثر من 96% من بياناتها بالإنجليزية، وأن مقيّميها في الغالب ناطقون بالإنجليزية يقيمون في الولايات المتحدة أو جنوب شرق آسيا. ترجمة أزواج كهذه تُبقي ذوقهم على حاله.
  2. النموذج يتعلم تفضيل الأسلوب المترجم. تذكر ورقة Dang وزملائه (2024) أن آثار الترجمة (Translationese) قد تضر بالأداء، ولذلك قابلوا في أزواجهم إجابات مترجمة آليًا بإجابات مولَّدة مباشرة باللغة الهدف، فجاءت الإجابة المترجمة في موضع «الإجابة الرديئة» في 91% من الأزواج، بحسب الورقة.
  3. الترجمة تُسقط اللهجة. المترجم ينتج فصحى، والمستخدم الخليجي يكتب «وش» و«أبي» و«الحين»، فلا يرى نموذج المكافأة سؤالًا لهجيًا واحدًا.
  4. الموجّهات نفسها ليست عربية. وجدت دراسة Naous وزملائه أن النماذج متعددة اللغات، وحتى العربية أحادية اللغة، تميل إلى الكيانات المرتبطة بالثقافة الغربية. وأسئلة مترجمة عن «عيد الشكر» لن تصحح هذا الميل.

ولا تحل البيانات الاصطناعية المشكلة: نشرح في مقالتنا عن حدود البيانات العربية الاصطناعية (بالإنجليزية) لماذا تنجرف نحو الفصحى.

معيار تقييم عربي للإجابات: ماذا يقيس المقيّم؟

معيار «مفيدة وصادقة وغير ضارة» لا يسأل عما يلاحظه المستخدم العربي أولًا: هل تكلّمني الإجابة بلغتي؟ والحل معيار متعدد الأبعاد (Rubric) يمنح كل بُعد درجة من 0 إلى 4 قبل الحكم العام. الجدول توضيحي ويُكيَّف لكل منتج:

البُعدسؤال المقيّمما يُنزل الدرجة إلى 0
الصحة والسلامة (بوابة)هل في الإجابة خطأ جوهري أو ضرر؟معلومة خاطئة، أو رفض سؤال بريء
اتباع الطلبهل أجابت عما سُئل، ضمن قيوده؟تجاهل قيد صريح مثل «بدون تكلّف»
مطابقة اللهجةهل تبقى في المتغير الذي تحدده سياسة المنتج؟خلط لهجتين، كأن تقول «دلوقتي» في رد نجدي
مستوى الخطاب (Register)هل تناسب الرسمية المقام؟فصحى متكلفة لسؤال عائلي، أو عامية في خطاب رسمي
الملاءمة الثقافيةهل تنطلق من أعراف المستخدم لا من أعراف غيره؟اقتراحات غريبة على المقام، أو قوالب نمطية
طبيعية العربيةهل تبدو مكتوبة بالعربية أم مترجمة إليها؟تراكيب منقولة مثل «لا تتردد في سؤالي»

وثلاث قواعد تجعل المعيار قابلًا للتطبيق. البوابة قبل الذوق: الإجابة الخاطئة أو الضارة تخسر مهما سلمت لهجتها. الطول ليس معيارًا: وجد Singhal وزملاؤه أن تحسّن المكافأة في تجارب RLHF التي درسوها يعود في معظمه إلى إطالة الإجابات، وأن نماذج المكافأة تتأثر بسهولة بانحياز الطول في بيانات التفضيل؛ فاكتب في المعيار أن الإيجاز المناسب ميزة. قوة التفضيل ترافق الاختيار: «أفضل بكثير» أو «أفضل قليلًا» أو «تعادل» أو «كلتاهما غير مقبولة».

مثال عملي: إجابتان على سؤال بلهجة نجدية

المثال التالي توضيحي، كتبناه لشرح طريقة الحكم، وليس من بيانات عميل أو من مخرجات نموذج بعينه.

الموجّه: «عندنا عزيمة يوم الخميس وجايينا ضيوف كبار بالسن، وش أقدّم لهم أول ما يوصلون؟ أبي شي بدون تكلّف.»
الترجمة: لدينا دعوة يوم الخميس ويزورنا ضيوف كبار في السن، ماذا أقدّم لهم أول وصولهم؟ أريد شيئًا بلا تكلّف.

الإجابة (أ): «يسعدني مساعدتك في التخطيط لهذه المناسبة الرائعة! إليك بعض الأفكار: 1) مشروبات ترحيبية كالعصائر الطبيعية أو شاي الأعشاب. 2) مقبلات خفيفة مثل أطباق الأجبان والبسكويت المالح. 3) حلويات صغيرة كالكعك والفطائر. تذكّر مراعاة أي قيود غذائية لدى ضيوفك، ولا تتردد في سؤالي إن احتجت إلى أفكار إضافية!»

الإجابة (ب): «أول شي القهوة والتمر، وابدأ بالكبار. خلّ الدلة جاهزة قبل يوصلون، وصبّ باليمين. وبعدها الشاي، وإذا تبي تزيد حط معها شي خفيف، وخلّ فيه خيار بدون سكر.»
الترجمة: أولًا القهوة والتمر، وابدأ بكبار السن. جهّز الدلّة قبل وصولهم، واسكب باليد اليمنى. ثم الشاي، وإن أردت الزيادة فقدّم معها شيئًا خفيفًا، واجعل بينه خيارًا بلا سكر.

الحكم: (ب) أفضل بكثير. الإجابة (أ) سليمة وآمنة ومنظمة وأطول، وهي بالضبط الصفات التي تغري مقيّمًا لا يعرف السياق، ونموذج مكافأة يميل إلى الطول. لكنها تتجاهل أعراف الضيافة: فتقديم القهوة العربية لكبار السن والضيوف أولًا، وسكبها باليد اليمنى، من الآداب التي توثّقها قائمة اليونسكو للتراث الثقافي غير المادي. وتخالف قيد «بدون تكلّف» بثلاثة أصناف، وتنتهي بعبارة تبدو مترجمة. أما (ب) فترد بلهجة السائل، وتلتزم بطلبه، وتبدأ بما يتوقعه ضيفه.

ويُسجَّل الحكم في سجل كهذا:

الحقلالقيمة
لهجة الموجّهنجدية
لهجة المقيّمنجدية (مطابقة)
المختارة / المرفوضة(ب) / (أ)
قوة التفضيلأفضل بكثير
رموز الأسباب لـ (أ)ملاءمة ثقافية، تجاهل قيد، ترجمة حرفية، إطالة

لو حكم على هذا الزوج مقيّم لا يعرف هذا العرف لربما فازت (أ)، فيتعلم النموذج أن الإجابة الجيدة طويلة ومحايدة ثقافيًا. ولاحظ أن رد (ب) العامي صحيح لأن السؤال عائلي؛ أما في رسالة إلى جهة رسمية فقد تكون الفصحى هي الصواب. هذا قرار تكتبه سياسة مستوى الخطاب، لا اجتهاد كل مقيّم.

اختيار المقيّمين بحسب اللهجة والتخصص

النموذج يُواءَم مع من قيّموه، فالسؤال الأول: من يحق له الحكم على هذا الموجّه؟

  • طابِق المقيّم مع اللهجة، لا مع «العربية». المقيّم الشامي قد يفهم السؤال النجدي، لكنه قد لا يلتقط ما يتوقعه الضيف في مجلس نجدي. واختبر اللهجة بموجّهات حقيقية، ولا تكتفِ بالإفادة الذاتية. وأثر تغطية اللهجات على سقف النموذج في مقالتنا عن الفصحى واللهجات (بالإنجليزية).
  • المجال قبل اللغة في الأسئلة المتخصصة. صحة إجابة عن جرعة دواء يحكم عليها طبيب، ثم يحكم اللغوي على لغتها.
  • لا تسلّم الحكم على اللهجة لنموذج لم تختبره. في LabelBench بلغت دقة نموذج لغوي محلي (Qwen 2.5 3B) في تحديد اللهجة بين خمس مناطق 22.4% على مجموعة التقييم المحجوزة الثابتة، والتخمين العشوائي 20%. التفصيل في مقالتنا عن حدود النماذج المُحكِّمة بالعربية (بالإنجليزية).

المعايرة والاتفاق بين المقيّمين

الأسئلة المفتوحة تحتمل أكثر من إجابة جيدة، فلا يُتوقع اتفاق تام. في InstructGPT اتفق مقيّمو التدريب فيما بينهم في نحو 72.6% من الحالات، والمقيّمون المحجوزون الذين لم يُنتجوا بيانات التدريب في نحو 77.3%. فإن رأيت اتفاقًا شبه تام على موجّهات عربية مفتوحة، فتحقق: قد يكون المقيّمون يحكمون على الطول أو الرسمية لا على الجودة. وخطوات المعايرة:

  1. أزواج ذهبية قبل الإنتاج: أزواج حكّمها لغويون من أهل اللهجة بتعليل مكتوب، يتأهل عليها المقيّمون، ثم تُدَسّ في العمل لرصد الانحراف.
  2. ترتيب عشوائي للإجابتين: حتى لا يُكافأ الموضع الأول.
  3. قياس مصحَّح للصدفة: مثل كابا لكوهين (Cohen's kappa) للاختيار الزوجي، مع تقرير مستقل لكل لهجة، لأن المتوسط العام يخفي اللهجة المتعثرة.
  4. التفريق بين الخطأ والخلاف المشروع: خطأ تطبيق المعيار يُحكَّم ويُعاد العمل عليه. أما اختلاف مقيّم نجدي وآخر حجازي فيما يُعدّ لائقًا، فيُحفظ فيه الحكمان موسومين بلهجة كل منهما، لأن حسمه بالأغلبية يواءم النموذج مع مجتمع واحد بصمت.
  5. مراجعة المعيار بعد كل دفعة: الخلاف المتكرر على نوع واحد من الأسئلة عيب في المعيار لا في المقيّمين.

وأساس ذلك كله دليل مكتوب ومجموعة ذهبية وتحكيم، كما في دليل توسيم البيانات العربية.

كيف تتعامل Bayanat Labs مع بيانات التفضيل العربية؟

تقدّم Bayanat Labs خدمات ترتيب التفضيل والضبط الدقيق وإعادة الكتابة ونمذجة المكافأة واختبارات الاختراق الأحمر (Red-teaming) للنماذج العربية، وتعمل على البيانات فقط دون أن تنافس نماذج عملائها. ويتولى الحكم متحدثون أصليون مدقَّقون ولغويون ومختصون مرخّصون يغطون أكثر من 25 لهجة وتنويعة عربية، ويجتازون فرزًا في اللهجة والمجال قبل رؤية بيانات العميل. ويُعايَر العمل على أزواج ذهبية مع تحكيم وإعادة عمل وسجل تدقيق لكل مهمة، وتُستضاف البيانات داخل المنطقة افتراضيًا، ويبدأ التعاون بمشروع تجريبي بنطاق ثابت يُنجَز عادةً خلال أسبوعين. التفاصيل في صفحة التعلم المعزز من ملاحظات البشر للنماذج العربية، ولقياس أثرها بعد التدريب راجع خدمات تقييم نماذج اللغة العربية.

أهم النقاط
  • بيانات التفضيل تنقل ذوق المقيّمين. والأزواج المترجمة تحمل أحكام غيرك وأسلوب الترجمة.
  • DPO ونماذج المكافأة تتغذى على المادة نفسها: موجّه وإجابة مختارة وأخرى مرفوضة، ومعها لهجة المقيّم وقوة التفضيل.
  • المعيار العربي يقيس اللهجة والمقام والعرف، بعد بوابة الصحة والسلامة، ولا يكافئ الطول.
  • طابِق المقيّم مع اللهجة والمجال واختبره فيهما.
  • الاتفاق التام ليس هدفًا. قِسه مصحَّحًا للصدفة لكل لهجة، واحفظ الخلاف المشروع بدل حسمه بالأغلبية.

أسئلة شائعة

ما الفرق بين بيانات الضبط الدقيق (SFT) وبيانات التفضيل؟

بيانات الضبط الدقيق الموجَّه (SFT) أزواج من موجّه وإجابة نموذجية واحدة، يتعلم منها النموذج أن يقلّد. أما بيانات التفضيل فتقارن بين إجابتين أو أكثر للموجّه نفسه، فيتعلم النموذج أيّها أفضل ولماذا. الأولى تعلّمه شكل الإجابة، والثانية تصقل حكمه في الدقائق: النبرة، واللهجة، والإيجاز، ومتى يرفض. ولذلك يأتي التفضيل عادةً بعد الضبط الدقيق.

هل أجمع بيانات التفضيل بالفصحى أم باللهجات؟

اجمعها بالمزيج الذي يكتب به مستخدموك فعلًا. إن كان مساعدك يستقبل أسئلة بالنجدية والحجازية والمصرية، فلتضمّها موجّهاتك، وليحكم على كل لهجة متحدثوها. أما لغة الرد نفسها فقرار منتج يُكتب في المعيار: هل يرد النموذج بلهجة المستخدم، أم بفصحى ميسّرة، أم بحسب المقام؟ المهم أن يطبّق جميع المقيّمين القرار نفسه.

هل يمكن الاستعاضة عن المقيّمين البشريين بنموذج لغوي (RLAIF)؟

يمكن أن يولّد النموذج الإجابات المرشحة ويفرزها أوليًا، لكن حكمه على اللهجة والمقام والعرف يحتاج إلى إثبات قبل الاعتماد عليه، فالمُحكِّم الذي لا يميّز اللهجات لا يحكم على مطابقتها. والنهج الآمن أن تقيس اتفاق المُحكِّم الآلي مع مقيّمين أصليين على مجموعة ذهبية من بياناتك، لكل لهجة، ثم تُبقي شريحة بشرية دائمة لتدقيق أحكامه.

هل تصلح مجموعات التفضيل العربية المنشورة على Hugging Face لتدريب نموذجي؟

قد تصلح نقطة بداية بعد قراءة بطاقة البيانات. اسأل: هل الموجّهات مكتوبة بالعربية أصلًا أم مترجمة؟ ومن قرّر أي الإجابتين أفضل، إنسان أم نموذج؟ وما اللهجات الممثَّلة؟ وما الرخصة؟ كثير من البطاقات لا تجيب عن هذه الأسئلة. وفي كل الأحوال اختبر النموذج بعد التدريب على مجموعة تقييم كتبها متحدثون أصليون، لا على جزء محجوز من البيانات نفسها.

ماذا أفعل حين تكون الإجابتان سيئتين أو متساويتين؟

لا تُجبر المقيّم على الاختيار. أضف خيارَي «تعادل» و«كلتاهما غير مقبولة»، واستبعد هذه الأزواج من بيانات DPO أو عالجها بطريقة مستقلة. فالزوج الذي تفوز فيه إجابة رديئة على أردأ منها يعلّم النموذج أن الرديء مقبول. والإجابة غير المقبولة فرصة: يعيد محرر أصلي كتابتها فتصبح إجابة مرجعية للضبط الدقيق، أو إجابة «مختارة» في زوج جديد.

اختبر بيانات التفضيل على مخرجات نموذجك

مشروع تجريبي بنطاق ثابت على عينة من مخرجات نموذجك: لهجات محددة بالاسم، ومعايرة على معيار ذهبي، وتقرير جودة، يُنجَز عادةً خلال أسبوعين، مع استضافة البيانات داخل المنطقة افتراضيًا.

اطلب مشروعًا تجريبيًا