معايير تقييم النماذج اللغوية العربية: كيف تختبر نموذجًا بالفصحى واللهجات
درجة لوحة الصدارة أقل الأرقام دلالة على جاهزية نموذجك لعملائك. دليل عملي: لماذا تضلل المعايير المترجمة، وما الأبعاد الخمسة التي تُقاس لكل لهجة، ومقارنة لأبرز المعايير العربية، وبروتوكول تقييم تستطيع الدفاع عن نتائجه.
معايير تقييم النماذج اللغوية العربية نوعان: معايير مرجعية عامة (Benchmarks) مثل ArabicMMLU ومؤشر بلسم ولوحة OALL، تصلح لتضييق قائمة النماذج المرشحة، وتقييم خاص تبنيه على لهجات مستخدميك ومهامك، وهو وحده ما يصلح لقرار الإطلاق. والتقييم الذي يُعتمد عليه يقيس خمسة أبعاد منفصلة لكل لهجة، على موجّهات (Prompts) كُتبت بالعربية أصلًا لا مترجمة، ويحكم فيه متحدثون أصليون حيث يكون الحكم البشري هو المقياس.
يشرح هذا الدليل لماذا تعطي المعايير المترجمة صورة أفضل من الواقع، وما الذي تقيسه بالضبط، وماذا يغطي كل معيار عربي معروف حتى سبتمبر 2026، ثم يقدّم بروتوكولًا عمليًا من سبع خطوات، مع أحجام العينات ودور النماذج المُحكِّمة.
لماذا تضلل معايير التقييم المترجمة؟
بدأت أجزاء كبيرة من منظومة التقييم العربية ترجمةً آلية لمجموعات إنجليزية. والترجمة تنقل معها الإطار الثقافي الإنجليزي وصياغاته، فتنتج عربية مترجَمة (Translationese) لا يكتبها عربي، ويكافئ الاختبار النموذج البارع في الإنجليزية المنقولة إلى العربية لا في العربية نفسها. والسؤال المترجم عن مؤسسات أمريكية يقيس معرفة أمريكية بحروف عربية.
وقد وصل القائمون على لوحة Open Arabic LLM Leaderboard إلى النتيجة نفسها: في النسخة الثانية (فبراير 2025) حذفوا المهام المترجمة آليًا لتدنّي جودتها واحتمال انحيازها الثقافي، وحذفوا المهام التي تشبّعت فيها الدرجات. وتتكرر في المعايير المنشورة ثلاث مشكلات أخرى:
- الفصحى وحدها لا تمثّل مستخدميك. العربية لغة ازدواجية (Diglossia): الكتابة الرسمية بالفصحى، والمحادثة اليومية والدردشة باللهجات. ومجموعة اختبار من فصحى نظيفة تترك النموذج دون اختبار على ما سيستقبله فعلًا. لذا تعامَل أي «درجة عربية» بلا تفصيل للهجات على أنها درجة فصحى.
- المتوسط يخفي الإخفاق المهم. نموذج قوي في المصرية وضعيف في الخليجية ليس «متوسط الجودة»، بل غير صالح لنشر في السعودية. والدرجة المدمجة تخفي بالضبط الخطر الذي تريد قياسه.
- الإملاء يربك المقاييس الآلية. الكتابة العربية تقبل تنوعًا مشروعًا تعاقبه مقاييس المطابقة التامة: «إلى» و«الى»، و«مدرسة» و«مدرسه»، و«أحمد» و«احمد»، مع التشكيل أو بدونه. حدّد قواعد التطبيع (Normalization) قبل التصحيح، وطبّقها على كل النماذج بالطريقة نفسها، وإلا قارنت إملاء النماذج لا فهمها. وللتقطيع (Tokenization) أثر آخر: النص نفسه قد يستهلك عددًا مختلفًا جدًا من الرموز بين نموذج وآخر، فتتغير الكلفة وطول السياق المتاح.
كيف تقيّم نموذج لغة عربي؟ خمسة أبعاد تُقاس لكل لهجة
أبلغ عن كل بُعد منفصلًا، لكل لهجة ولكل مجال، ولا تدمجها في رقم واحد. الأمثلة في الجدول توضيحية لنوع البند المطلوب.
| البُعد | السؤال الذي يجيب عنه | مثال بند اختبار (توضيحي) | من يحكم |
|---|---|---|---|
| فهم اللهجة (Dialect comprehension) | هل يفهم النموذج لهجات سوقك، والتبديل اللغوي (Code-switching) والعربيزي (Arabizi)، أم الفصحى وحدها؟ | السؤال نفسه بثلاث صيغ: «وش تبي؟» (خليجية)، «عايز إيه؟» (مصرية)، «شو بدك؟» (شامية)، ومعناها كلها «ماذا تريد؟» | سكربت إن كان الجواب محددًا، وإلا متحدث أصلي |
| سجلّ التوليد (Generation register) | هل يرد باللهجة ومستوى الرسمية المناسبين، دون ركاكة الترجمة؟ | عميل سعودي يكتب بالعامية، فيرد النموذج بالمصرية «حاضر، هشوف لحضرتك»، أو بعبارة مترجمة مثل «أنا آسف لسماع ذلك» | متحدث أصلي للهجة نفسها |
| الدقة الإقليمية (Regional factuality) | هل يعرف جهات المنطقة وأنظمتها وتقويمها، لا معارف عامة مترجمة؟ | «متى اليوم الوطني السعودي؟» والجواب 23 سبتمبر | إجابة مرجعية، ومراجع من المنطقة للحالات الملتبسة |
| المواءمة الثقافية والسلامة (Cultural & safety alignment) | هل يراعي الأعراف والحساسية الدينية، دون رفض مفرط (Over-refusal) لأسئلة مشروعة؟ | سؤال عن أحكام صيام المسافر يُجاب بعناية ولا يُرفض | مقيّمون أصليون ذوو خبرة ثقافية |
| مهام المجال (Domain tasks) | هل ينجز المهمة الفعلية على توزيع بياناتك؟ | تلخيص عقد إيجار، أو استخراج حقل «اعرف عميلك» (KYC) من محادثة بالعامية | مختص مرخّص في المجال |
الفصل بين الفهم والتوليد ضروري لأنهما مهارتان مختلفتان: قد يفهم النموذج سؤالًا بالنجدية ثم يجيب بفصحى متكلفة أو بلهجة أخرى. ويؤكد ذلك معيار ArabCulture-Dialogue (أبريل 2026)، الذي يقارن حوارات ثقافية بالفصحى وبلهجات 13 بلدًا عربيًا في ثلاث مهام: الاستدلال الثقافي بالاختيار من متعدد، والترجمة بين الفصحى واللهجة، وتوجيه التوليد نحو لهجة محددة. وجد الباحثون أن أداء النماذج أضعف في المهام الثلاث كلها حين يكون الحوار باللهجة.
أبرز معايير تقييم النماذج اللغوية العربية (حتى سبتمبر 2026)
يلخص الجدول ما يقيسه كل معيار وحدوده لقرارك. الأوصاف مأخوذة من الأوراق وصفحات المعايير المرتبطة، وهي صحيحة حتى سبتمبر 2026. تعمّدنا عدم ذكر ترتيب النماذج، لأن لوحات الصدارة تتغير أسرع من أي مقال؛ راجع اللوحة نفسها يوم قرارك.
| المعيار | ماذا يقيس | الفصحى أم اللهجات | طريقة التصحيح | ما لا يخبرك به |
|---|---|---|---|---|
| ArabicMMLU (2024) | المعرفة والاستدلال: 14,575 سؤالًا في 40 مهمة، من امتحانات مدرسية في شمال أفريقيا والشام والخليج | فصحى، مكتوبة بالعربية أصلًا | اختيار من متعدد | جودة ما يكتبه النموذج، واللهجات |
| DialectalArabicMMLU (2025) | 3,000 سؤال في 32 مجالًا، مترجمة ومكيّفة يدويًا إلى خمس لهجات، مع الفصحى والإنجليزية | السورية والمصرية والإماراتية والسعودية والمغربية | اختيار من متعدد | قدرة النموذج على الرد باللهجة |
| Open Arabic LLM Leaderboard v2 (فبراير 2025) | لوحة مفتوحة تجمع ArabicMMLU وMMLU مترجمًا بشريًا وAlGhafa وEXAMS وBelebele وMadinahQA وAraTrust للسلامة وALRAGE للإجابة المعتمدة على الاسترجاع | فصحى أساسًا | اختيار من متعدد في معظمه؛ ALRAGE بنموذج مُحكِّم على سلّم 0–10 | الأسلوب والمقام وأداء مجالك |
| BALSAM (مؤشر بلسم، 2025) | 78 مهمة في 14 فئة، و52 ألف مثال (37 ألفًا للاختبار و15 ألفًا للتطوير)، بينها مهام توليدية كالكتابة الإبداعية | فصحى أساسًا | نموذج مُحكِّم على سلّم 0–3، ومجموعة اختبار محجوبة | حوارات متعددة الجولات على منتجك |
| HELM Arabic (ديسمبر 2025) | سبعة معايير (منها ArabicMMLU وAraTrust وALRAGE) بإعدادات موحّدة وطلبات وردود منشورة | فصحى | بدون أمثلة (Zero-shot)، حتى 1,000 بند عشوائي من كل مجموعة فرعية | اللهجات والتوليد الحر |
| ArabCulture-Dialogue (2026) | حوارات ثقافية متوازية بالفصحى واللهجة من 13 بلدًا، في 12 موضوعًا يوميًا | الفصحى و13 لهجة | اختيار من متعدد، وترجمة، وتوليد موجَّه باللهجة | مهام مجالك وسلوك الوكلاء |
للمقارنة التفصيلية بين هذه المعايير وغيرها، مثل AraTrust وAraDiCE وPalm، راجع دليلنا لمعايير النماذج العربية (بالإنجليزية).
ما هو مؤشر بلسم لتقييم النماذج العربية؟
بلسم منصة لقياس أداء النماذج اللغوية الكبيرة في مهام معالجة العربية، يديرها مجمع الملك سلمان العالمي للغة العربية بمشاركة جهات أكاديمية وحكومية منها سدايا وجامعة محمد بن زايد للذكاء الاصطناعي. وتذكر صفحة المنصة أكثر من 50 ألف سؤال و78 مهمة وأكثر من ألف مجموعة بيانات. ما يميّزه أمران: أن كثيرًا من مهامه توليدية يصححها نموذج مُحكِّم على إجابات مرجعية، لا اختيار من متعدد، وأن مجموعة الاختبار محجوبة حتى عن معظم المساهمين فيها، فيصعب أن تتسرب إلى بيانات التدريب. أما حدّه فهو حدّ كل معيار عام: يقيس النموذج على مهام عامة، لا على لهجات عملائك ومنتجك.
ماذا تقول الأرقام عن اللهجات؟
حين يُفصل أداء اللهجات تنخفض الدرجات. في DialectalArabicMMLU بلغ متوسط دقة 19 نموذجًا مفتوح الأوزان (من 1B إلى 13B) على اللهجات الخمس 47.7%، مقابل 51.9% للأسئلة نفسها بالفصحى و62.8% بالإنجليزية. وكانت السعودية عند 48.2% والمغربية الأدنى عند 45.0%. الفجوة بين الفصحى واللهجات هنا نحو أربع نقاط على أسئلة اختيار من متعدد؛ وفي التوليد، حيث يُطلب من النموذج أن يكتب باللهجة، تظهر الفجوة أيضًا كما في ArabCulture-Dialogue. لذلك نشرح في مقالنا عن الفصحى واللهجات (بالإنجليزية) لماذا يجب تسمية كل لهجة تحتاجها بالاسم.
بروتوكول تقييم عملي من سبع خطوات
الأبعاد وحدها لا تكفي؛ المنهجية تحدد إن كانت النتيجة قابلة للدفاع عنها. نفّذ الخطوات بالترتيب:
- اكتب القرار أولًا. اختيار نموذج، أم موافقة على الإطلاق، أم اختبار انحدار (Regression) بعد ضبط دقيق؟ وحدّد عتبة النجاح لكل بُعد قبل أن يرى أحد مخرجات أي نموذج. التقييم بلا قرار يتحول إلى لوحة صدارة أخرى.
- حوّل حركة الاستخدام إلى خلايا. اكتب اللهجات والمجالات وحصة كل منها. كل تقاطع بين لهجة وبُعد خلية تحتاج عينتها الخاصة. وإن سحبت الموجّهات من سجلات حقيقية فهي بيانات شخصية؛ راجع نظام حماية البيانات الشخصية وبيانات تدريب الذكاء الاصطناعي.
- اكتب الموجّهات بالعربية أصلًا. يكتبها متحدثون أصليون بكل لهجة مستهدفة، بما فيها التبديل اللغوي والعربيزي والأخطاء الإملائية التي يكتبها المستخدمون فعلًا. لا تترجم من الإنجليزية.
- ابنِ سلالم التقييم (Rubrics) والإجابات المرجعية. لكل بُعد سلّم مكتوب، مع مثالين أو ثلاثة لردود مصحّحة عند كل مستوى، وأعلام أخطاء حرجة تُسقط الرد مهما كانت درجته، كرسوم بنكية خاطئة تُذكر على أنها حقيقة.
- عاير المقيّمين على دفعة تجريبية. يصحح مقيّمون يتحدثون اللهجة المقيَّمة شريحة صغيرة، ثم تقيس الاتفاق بينهم لكل بُعد وتعيد صياغة ما التبس في السلّم قبل التوسع. إن كان الاتفاق منخفضًا فالتقييم يقيس المقيّمين لا النموذج. وهذه هي نفسها أسس ضبط الجودة في دليل توسيم البيانات العربية.
- قيّم تقييمًا معمّى (Blind). أخفِ هوية النماذج، واخلط ترتيب الردود، وادسّ بنودًا ذهبية لرصد انجراف المقيّمين. ولا تعتمد على بنود منشورة في أي قرار حاسم، فقد تكون دخلت بيانات تدريب النموذج.
- حلّل بهوامش خطأ، ثم جمّد المجموعة. أبلغ عن كل خلية بفاصل ثقة. وعند مقارنة نموذجين، صحّحهما على البنود نفسها وقارن الفروق بندًا ببند. ثم احتفظ بنسخة خاصة مجمّدة تعيد تشغيلها مع كل نسخة جديدة، وأضف بنودًا جديدة دوريًا.
كم بندًا تحتاج لكل لهجة؟
ما يكفي لأن يكون فاصل الثقة في كل خلية أضيق من الفرق الذي تريد رصده. يعرض الجدول هامش الخطأ التقريبي عند مستوى ثقة 95% لنسبة نجاح، بالتقريب الطبيعي ±1.96 × √(p(1−p)/n). الأرقام حساب رياضي، لا نتائج تقييم.
| عدد البنود في الخلية | نسبة نجاح 50% | نسبة نجاح 90% |
|---|---|---|
| 50 | ±13.9 نقطة | ±8.3 نقطة |
| 100 | ±9.8 نقطة | ±5.9 نقطة |
| 200 | ±6.9 نقطة | ±4.2 نقطة |
| 400 | ±4.9 نقطة | ±2.9 نقطة |
النتيجة العملية: احسب العينة لكل لهجة لا للمجموعة كلها. مجموعة من ألف موجّه، منها 850 بالفصحى و50 لكل واحدة من ثلاث لهجات، تترك هامشًا يقارب ±13 نقطة على كل لهجة (مثال توضيحي)، وهو أوسع من أن يُبنى عليه قرار إطلاق بلهجة. والموجّهات المتقاربة، كعشر صيغ لنية واحدة، لا تُحسب عشر ملاحظات مستقلة.
المقيّمون البشر أم النماذج المحكِّمة (LLM-as-a-judge)؟
القاعدة: أتمت ما يمكن التحقق منه آليًا، وأبقِ البشر حيث يكون الحكم نفسه هو المقياس. الإجابات المحددة وصيغ المخرجات ووسائط استدعاء الأدوات يصححها سكربت. والمقارنة السريعة بين نسختين أثناء التطوير يمكن أن يتولاها نموذج مُحكِّم بعد معايرته. أما سجلّ اللهجة والملاءمة الثقافية والدقة في المجال فتحتاج متحدثين أصليين ومختصين، لأن الرد المعقول الخاطئ يمر على غير المختص.
الأدلة تدعم نهجًا هجينًا لا استبدالًا كاملًا. في الورقة المنشورة عن BALSAM، ارتبطت درجات النموذج المُحكِّم بأحكام المقيّمين البشر ارتباطًا عاليًا في كل الفئات (بين 0.824 و0.977)، على عينة تقييم بشري من 254 سؤالًا في 13 فئة. وتذكر الورقة أن اتفاق المقيّمين البشر فيما بينهم كان أدنى (متوسط ارتباط 0.75)، وهو تذكير بأن الحكم البشري نفسه يحتاج معايرة. لكن ذلك على مهام لها إجابات مرجعية؛ وحين يغيب المرجع ويصبح الحكم على المقام والعرف، يصعب على المُحكِّم الآلي أن يكون أفضل من فهمه للهجة. وفي LabelBench، تدقيقنا القابل لإعادة الإنتاج، حقق نموذج لغوي محلي (a local language model) دقة مطابقة تامة (exact-match accuracy) قدرها 78% حين اختُزلت السمية العربية إلى «نعم أو لا»، ثم هبط إلى 25.3% على التصنيف متعدد الوسوم الفعلي، وإلى 22.4% في تحديد خمس مناطق لهجية (والتخمين العشوائي 20%)، على قائمة الاختبار الثابتة المحجوزة (fixed held-out manifest). التوسيم مهمة مختلفة عن التحكيم، لكن الدرس واحد: لا تسلّم الحكم على اللهجة لنموذج لم تختبره عليها. التفاصيل في مقالنا عن النماذج المحكِّمة بالعربية (بالإنجليزية).
الوصفة العملية: يصحح مقيّمون أصليون شريحة من بياناتك، ثم تقيس اتفاق المُحكِّم الآلي معهم لكل بُعد ولكل لهجة، ولا تؤتمت إلا ما بلغ فيه الاتفاق عتبتك، وتعيد الخلافات والفئات الحرجة إلى البشر. وأعد المعايرة كلما تغيّر النموذج المُحكِّم أو السلّم أو مزيج الاستخدام. والمنطق نفسه يحكم بيانات التفضيل التي تُبنى من هذه الأحكام؛ انظر دليل بيانات RLHF العربية.
متى تحتاج تقييمًا مخصصًا لا معيارًا عامًا؟
المعايير العامة تكفي لتضييق القائمة من عشرة نماذج إلى ثلاثة. وتحتاج تقييمًا مخصصًا في أي من الحالات التالية:
- منتجك يتحدث بلهجة. مساعد يستقبل النجدية أو الحجازية أو المصرية يحتاج اختبار فهم وتوليد بتلك اللهجات تحديدًا، ولا يغطي أي معيار عام مزيج مستخدميك بنسبه.
- المجال منظَّم أو عالي المخاطر. البنوك والصحة والقانون والجهات الحكومية: الخطأ المقنع أخطر من الرفض، ولا يرصده إلا مختص.
- ضبطت النموذج ضبطًا دقيقًا. المعايير العامة لا تخبرك كيف تغيّر سلوكه بعد الضبط، ولا إن كان تحسن الفصحى قد جاء على حساب لهجة أو على حساب السلامة.
- النموذج يتخذ إجراءات. الوكيل الذي يلغي طلبًا أو يحجز موعدًا يُقيَّم بحالة النظام بعد المحادثة، لا بطلاقة رده. في مختبر موثوقية الوكلاء العربية، وهو إصدار تجريبي لمنهجية التقييم على مجموعة اختبار اصطناعية مفتوحة، أكد وكيل في إحدى المحاولات أنه ألغى طلبًا، بينما لم يستدعِ سوى أداة الاستعلام عن الطلب، وبقيت حالة الطلب في النظام «مُجهَّز للشحن» (packed). الرد الطليق ليس معاملة مكتملة. وهذه نتيجة تطوير لا نسبة دقة ولا شهادة اعتماد.
- ستبني قرارًا ماليًا أو تنظيميًا على النتيجة. اختيار مزوّد لسنوات، أو موافقة لجنة المخاطر، يحتاج نتائج خاصة غير منشورة، مع الأحكام الخام وسجل تدقيق.
هكذا نعمل في خدمات تقييم نماذج اللغة العربية لدى Bayanat Labs: موجّهات تُكتب أصلًا بكل لهجة، ومقيّمون يجتازون فحص اللهجة والمجال ويُعايَرون على مجموعات ذهبية مع تحكيم للخلافات وحلقات إعادة عمل، وتقييمات تغطي فهم اللهجات والملاءمة الثقافية والدقة والسلامة، مع سجل تدقيق لكل مهمة. نعمل في البيانات فقط ولا نبني نماذج، فلا مصلحة لنا في ترجيح نموذج على آخر. ويُسلَّم المشروع التجريبي محدد النطاق، بضبط جودة على مجموعة ذهبية وتقرير جودة أو تقرير معياري، خلال أسبوعين في العادة.
- المعايير العامة للتصفية لا للقرار. استخدم ArabicMMLU وOALL وبلسم وHELM Arabic لتضييق القائمة، ثم قرّر على مجموعة اختبار خاصة من لهجات مستخدميك ومهامك.
- الدرجة المدمجة درجة فصحى. اطلب نتيجة لكل لهجة ولكل بُعد من الأبعاد الخمسة، فالمتوسط يخفي الإخفاق الذي يهمك.
- اكتب ولا تترجم. الموجّهات المترجمة تقيس الإنجليزية المنقولة، وتعطي صورة أفضل من الواقع.
- احسب العينة لكل لهجة. 200 بند للخلية تعطي هامشًا نحو ±7 نقاط عند 50%، و50 بندًا تعطي نحو ±14.
- المقيّمون هم المقياس. أتمت ما يُتحقق منه آليًا، وعاير النموذج المُحكِّم على مقيّمين أصليين، وقيّم الوكلاء بحالة النظام لا بنص الرد.
أسئلة شائعة
ما أفضل معيار لتقييم نموذج لغوي عربي؟
لا يوجد معيار واحد يكفي. المعايير المكتوبة بالعربية أصلًا، مثل ArabicMMLU ومهام لوحة OALL ومؤشر بلسم، تصلح لتضييق قائمة النماذج المرشحة، ويكشف DialectalArabicMMLU حجم التراجع خارج الفصحى. أما قرار الاختيار أو الإطلاق فيحتاج مجموعة اختبار خاصة كتبها متحدثون أصليون بلهجات مستخدميك وعلى مهامك الفعلية، لأن المعايير العامة لا تعرف منتجك ولا جمهورك.
ما الفرق بين مؤشر بلسم ولوحة OALL وHELM Arabic؟
بلسم منصة يديرها مجمع الملك سلمان العالمي للغة العربية بالشراكة مع جهات منها سدايا، وتعتمد مجموعة اختبار محجوبة وتصحيحًا بنموذج مُحكِّم لمهام توليدية كثيرة. ولوحة OALL مفتوحة على Hugging Face وتجمع مهام معظمها اختيار من متعدد. أما HELM Arabic فمن مركز CRFM في ستانفورد بالتعاون مع Arabic.AI، ويركز على الشفافية وقابلية إعادة التجربة. كلها مفيدة للمقارنة الأولية، ولا يغني أيّها عن اختبار على بياناتك.
كم مرة يجب إعادة تقييم النموذج اللغوي العربي؟
قيّم قبل اختيار النموذج، ثم أعد تشغيل مجموعة الاختبار الخاصة المجمّدة نفسها مع كل ضبط دقيق أو تعديل على قالب الموجّه أو ترقية للنموذج، لأن تحسنًا في الفصحى قد يخفي تراجعًا في الخليجية أو في السلامة. وأضف بنودًا جديدة دوريًا حتى لا تتسرب المجموعة إلى بيانات التدريب أو تتحول إلى هدف يُضبط النموذج عليه.
هل يمكن استخدام محادثات العملاء الحقيقية في مجموعة التقييم؟
نعم، فهي أصدق تمثيل لما سيواجهه النموذج، لكنها في الغالب بيانات شخصية. أزل المعرّفات أو استبدلها قبل أن يراها المقيّمون، واحصر الوصول في من يحتاجه، واحتفظ بسجل لمن اطّلع على ماذا، وتحقق من متطلبات نقل البيانات خارج المملكة قبل إرسالها إلى أي نموذج مستضاف في الخارج. التفاصيل في قائمة التحقق لنظام حماية البيانات الشخصية.
أي اللهجات يجب أن أختبر النموذج بها؟
اللهجات التي يكتب بها مستخدموك فعلًا، بحصصها التقريبية في حركة الاستخدام، إضافة إلى الفصحى. مساعد بنكي في الرياض قد يحتاج النجدية والحجازية والفصحى، وربما المصرية إن كانت شريحة من عملائه تكتب بها. ولا يكفي أن يفهم النموذج اللهجة، فاختبر أيضًا هل يرد بالسجلّ الذي يحدده دليل الأسلوب، وافصل نتيجة كل لهجة عن غيرها.