اللهجات السعودية والذكاء الاصطناعي: النجدية والحجازية والجنوبية والشرقية
«اللهجة السعودية» في كراسة الشروط ليست مواصفة. هذا المرجع يفصّل ما يميّز كل لهجة إقليمية، وما يتوفر من بيانات لها فعلًا، وأين تنكسر النماذج، وكيف يُكتب دليل توسيم لا يخلط بينها.
الجواب المختصر: أول ما يجب معرفته عن اللهجات السعودية والذكاء الاصطناعي أن «اللهجة السعودية» ليست لهجة واحدة: تقسّمها الأبحاث عادةً إلى الحجازية والنجدية والجنوبية والشمالية والشرقية، ولكل منها علامات في النطق والكتابة والمفردات. والنماذج تخطئ فيها بطرق متكررة: تنحاز إلى لهجة أوسع حضورًا في بيانات تدريبها، أو تنزلق إلى الفصحى، أو تهلوس في التفريغ الصوتي. والعلاج بيانات موسومة (Labeled Data) يوسّمها متحدثون أصليون من كل منطقة، بدليل توسيم يعرف أين تتقاطع هذه اللهجات وأين تفترق.
هل اللهجة السعودية لهجة واحدة؟
لا. تتفق الأبحاث على التعدد وتختلف على العدد. مدوّنة SDC-5 (Al-Shenaifi وآخرون، 2024) تضم 790,000 تغريدة موزعة على خمس لهجات إقليمية: الحجازية والنجدية والجنوبية والشمالية والشرقية. ومدوّنة SDCT (Bayazed وآخرون، 2020) اكتفت بثلاث، هي الحجازية والنجدية والشرقية، لأن مؤلفيها وجدوا تغريدات الجنوبية والشمالية شحيحة. ومجموعة SauDial (2025) تغطي أربعًا: النجدية والحجازية والجنوبية والشرقية.
وكثير من مصنّفات اللهجات يعمل على مستوى الأقاليم الكبرى، فلا فئة فيه للسعودية أصلًا: المصنّف الخماسي في دراسة Saudi-Dialect-ALLaM (2025) يوزّع النص على الخليجية والشامية والفصحى والمصرية والمغاربية فقط. والنتيجة: عبارة «بيانات باللهجة السعودية» في كراسة الشروط لا تحدد شيئًا. المواصفة الحقيقية تذكر الأقاليم، والقناة، والمستوى اللغوي (عامية خالصة أم «لهجة بيضاء» قريبة من الفصحى).
ما الفرق بين اللهجة النجدية والحجازية والشرقية؟ جدول السمات
الأمثلة مأخوذة من دليل التوسيم في مدوّنة SDCT ومن جدول الكلمات المفتاحية التي جُمعت بها تغريداتها. واختار مؤلفوها خمسة موسِّمين من خريجي جامعة الملك عبدالعزيز يُعدّون متحدثين أصليين، وسم أربعة منهم المدوّنة كاملة. وهي ميول لا قواعد: قد لا تظهر عند كل متحدث، وقد تجتمع علامتا لهجتين في جملة.
| اللهجة | علامة في النطق أو الكتابة | مفردات دالّة (من SDCT) | ما يعنيه للنموذج |
|---|---|---|---|
| الحجازية (الغرب) | الذال تصير دالًا، والثاء تاءً | «دحين» (الآن)، «اهرج» (تكلّم)، «كمان» (أيضًا) | كلمات بمعنى واحد تختلف عن النجدية؛ قائمة كلمات مبنية على لهجة واحدة تفوّت الأخرى |
| النجدية (الوسط) | الكاف تُنطق «تس» في بعض الكلمات | «هالحين» (الآن)، «وش» (ماذا)، «عيّا» (أبى، كما في «حسابي عيّا يفتح»)، «امحق» (للمبالغة) | أفعال مثل «عيّا» تحمل نية الشكوى دون أي كلمة فصيحة دالة عليها |
| الشرقية (الشرق) | الكاف تُنطق جيمًا، كما في «شفيج؟» (ما بكِ؟) | «وايد» (كثير)، «شنو» (ماذا)، «صج» (صحيح) | مفردات تُسمع أيضًا في دول الخليج المجاورة، فيختلط وسمها بالخليجية العامة |
| الجنوبية والشمالية | لا يسرد دليل SDCT علامات لهما، لأنه استبعدهما لشحّ البيانات | ضعيفة التمثيل؛ تحتاج متحدثين من المنطقة نفسها لا من «الجنوب» عمومًا | |
«دحين» و«هالحين» تعنيان الشيء نفسه، و«وش» و«شنو» كلتاهما «ماذا»: نموذج النوايا الذي يتعلم من لهجة واحدة يعامل الأخرى ككلمات مجهولة. ولقياس أثر هذه الفجوات على سقف أداء النموذج، راجع مقالنا عن تغطية اللهجات والفصحى (بالإنجليزية).
ما المتاح من مجموعات بيانات اللهجة السعودية؟
لكل مورد منشور حدٌّ يجب معرفته قبل الاعتماد عليه:
| المورد | النوع والحجم | اللهجات | ما يجب الانتباه إليه |
|---|---|---|---|
| SDCT (2020) | 4,180 تغريدة موسومة باللهجة والمشاعر | الحجازية، النجدية، الشرقية | صغيرة، وجُمعت بكلمات مفتاحية لهجية ضمن طرق أخرى، فالعلامة موجودة في النص غالبًا |
| SDC-5 (2024) | 790,000 تغريدة | خمس لهجات إقليمية | التوسيم يستعين بكلمات بذرية (Seed Words) وبيانات الموقع الجغرافي وتقنيات آلية، واتفاقه (Kappa) 0.90 بحسب الورقة |
| مدوّنتا SaudiBERT (2024) | نحو 141.9 مليون تغريدة (STMC) و15.2 GB من نصوص المنتديات (SFC) | سعودية عامة | بيانات تدريب مسبق غير موسومة؛ النموذج منشور على Hugging Face |
| SauDial (2025) | 1,000 مدخل لتوطين الألعاب، برخصة CC BY | النجدية، الحجازية، الجنوبية، الشرقية | مولّدة بـ GPT-4o ثم نقّحها مراجع خبير واحد، ويقرّ مؤلفوها بأنها قد لا تلتقط دقائق اللهجة |
| Saudi Dialect Instruction (2025) | 5,466 زوج تعليمات واستجابة | الحجازية والنجدية مناصفةً | اصطناعية، ولم تُنشر البيانات ولا الأوزان |
| SADA | 668 ساعة صوتية من 57 برنامجًا لهيئة الإذاعة والتلفزيون | النجدية والحجازية والخليجية أساسًا، مع لهجات أخرى | أعدّه وفرّغه المركز الوطني للذكاء الاصطناعي؛ ولا يُصنَّف نظيفًا منه إلا جزء محدود بحسب الورقة |
| مدوّنة «أصوات السعودية» | تسجيلات من أكثر من 40 نقطة جغرافية، لفئات عمرية مختلفة من الجنسين | لهجات محلية وفصحى | مشروع لمجمع الملك سلمان العالمي للغة العربية، أُعلن أن بياناته ستتاح للباحثين عبر منصة «فلك» (الشرق الأوسط، يونيو 2024)؛ تحقق من حالة الإتاحة الحالية |
الفجوات واضحة: أغلب النصوص تغريدات، وأغلب الصوت بث تلفزيوني لا يشبه مكالمة مركز اتصال. والجنوبية والشمالية الأضعف تمثيلًا، وقد استبعدهما مؤلفو SDCT أصلًا لندرة تغريداتهما. وجزء متزايد من الموارد الحديثة اصطناعي. والموقع الجغرافي لا يساوي اللهجة: قد يغرّد متحدث حجازي من الرياض فيُوسم نصه نجديًا.
اللهجات السعودية والذكاء الاصطناعي: أين تخطئ النماذج؟
1. الانهيار نحو لهجة واحدة
في LabelBench، اختبرنا تحديد اللهجة على اختبار ثابت محجوز (Fixed Held-out Manifest) من 500 عنصر متوازن بين خمسة أقاليم: المصرية والخليجية والعراقية والشامية والمغاربية. بلغت دقة المطابقة التامة لنموذج لغوي محلي (Qwen 2.5 3B) 22.4%، ومستوى الصدفة 20%. تعرّف النموذج على 85% من الأمثلة المصرية، لكنه توقّع «مصرية» لما بين 70% و80% من أمثلة كل إقليم آخر، ولم يتجاوز استدعاؤه للخليجية 4%. ورفع Fanar 1 9B، المتخصص في العربية، الدقة إلى 47.8% على العناصر نفسها، وبلغ استدعاؤه للخليجية 75%. هذا لا يعني أن النماذج المقيّمة لا تفهم اللهجة، بل أن أخطاء النموذج الأصغر على هذا الملف الثابت المحجوز تنحاز منهجيًا إلى لهجة واحدة. و«الخليجية» فيه إقليم واسع، فالتمييز بين نجدي وحجازي لم يُقس أصلًا.
2. الانزلاق إلى الفصحى
في دراسة Saudi-Dialect-ALLaM، صنّف مصنّف MARBERTv2 الخارجي 32.63% من إجابات ALLaM-7B-Instruct-preview على طلبات سعودية فصحى، و47.97% فقط خليجية (وهي الفئة التي تحتسبها الدراسة «سعودية»). وبعد ضبط دقيق بتقنية LoRA على بيانات حجازية ونجدية، انخفض التسرب إلى الفصحى إلى 6.21% وارتفعت النسبة الخليجية إلى 84.21%، لكن تقييم متحدثين أصليين قدّر صحة اللهجة بنسبة 68.83%. والفارق بين المصنّف والحكم البشري ثمن الاكتفاء بالقياس الآلي.
3. الهلوسة في التعرف على الكلام
على SADA، سجّل Whisper small معدل خطأ في الكلمات (WER) بلغ 254.86% دون ضبط، وWhisper medium 116.69%، أي أنه أضاف كلمات لم تُقل، وعزت الورقة ذلك إلى ميله للهلوسة. وأفضل نتيجة فيها، لنموذج MMS 1B بعد ضبطه على SADA مع نموذج لغوي رباعي (4-gram)، كانت WER بنسبة 40.9% وCER بنسبة 17.6% على الجزء النظيف من الاختبار. وكان نموذج XLSR المقيّم فيها أفضل بوضوح على الفصحى منه على الخليجية والنجدية. قواعد التفريغ التي تقلل هذه الأخطاء في معايير التفريغ الصوتي العربي.
في المقابل، حقق SaudiBERT، المدرّب مسبقًا على بيانات سعودية، متوسط F1 بلغ 86.15% في تحليل المشاعر و87.86% في تصنيف النصوص عبر 11 مجموعة بيانات، متفوقًا على ستة نماذج عربية متعددة اللهجات بحسب ورقته.
كيف توسّم بيانات اللهجات السعودية؟ أمثلة ومزالق
خمسة قرارات يجب أن يحسمها دليل التوسيم (Annotation Guidelines) قبل أن يبدأ أي موسِّم:
- أضف وسمًا للمختلط وغير المحدد. خصّص دليل SDCT وسمًا مستقلًا («SA»، ويسميه أيضًا اللهجة البيضاء) للتغريدات التي يصعب تحديدها أو تجمع كلمات من لهجتين. إجبار الموسِّم على الاختيار يصنع ضوضاء.
- لا تطبّع علامات اللهجة. تحويل «شفيج؟» إلى «شفيك؟» في مرحلة التنظيف يمحو علامة اللهجة الشرقية، ويمحو معها أن المخاطَب أنثى. قرر ما يُوحَّد (الهمزات، التطويل) وما يُترك كما هو.
- افصل وسم اللهجة عن الموقع. وسّم اللهجة من النص أو الصوت، واحفظ الموقع حقلًا منفصلًا. الخلط بينهما يعلّم النموذج الجغرافيا لا اللغة.
- توقّع خلافًا أكبر في المشاعر منه في اللهجة. في SDCT بلغ اتفاق الموسِّمين (Kappa) 0.94 على وسوم اللهجة، و0.32 فقط على المشاعر. مثال من الورقة: «كريمة بحق غيري امحق كرم»، أي كرم عظيم. الجذر يوحي بالإتلاف، والمعنى مدح. هذه البنود تحتاج تحكيمًا (Adjudication) لا تصويت أغلبية.
- اختبر الموسِّم على لهجته هو. المتحدث النجدي ليس بالضرورة مرجعًا في الحجازية أو في لهجات جازان. اربط كل موسِّم باللهجات التي اجتاز فرزها، وضع مجموعة ذهبية (Gold Set) لكل لهجة.
وقبل ترك جزء من هذا العمل للنموذج: لم يحقق أي نظام توليدي مُقيَّم في LabelBench v0.1 قيمة SAC95 أعلى من 0% وفق بروتوكول الثقة المتعادلة (Tied-confidence)، أي لم يُخرج أيٌّ منها جزءًا من الطابور من المراجعة البشرية عند حد جودة 95%. والمقياس أداة تشخيص، لا بديل عن اختبارات ضبط المخاطر. مراحل التوسيم وضبط الجودة كاملة في دليل توسيم البيانات العربية.
كيف تجمع بيانات اللهجات داخل المملكة؟
- جنّد بحسب منشأ اللهجة لا مكان السكن، واختبر المتحدث على لهجة المنطقة التي نشأ فيها.
- وزّع العينة عمدًا. حدد حصصًا للمنطقة والعمر والجنس والقناة، وارفع حصة الجنوبية والشمالية لأنها لن تأتي وحدها.
- اجمع القناة التي سيعمل عليها المنتج. بيانات البث لا تعلّم نموذج مركز الاتصال ضجيج الهاتف.
- وثّق الموافقة والغرض. التسجيلات الصوتية وبيانات المتحدثين بيانات شخصية، وأسئلة الإقامة والنقل عبر الحدود في قائمة التحقق لنظام حماية البيانات الشخصية (بالإنجليزية).
كيف نتعامل مع ذلك في Bayanat Labs: تدخل اللهجات الخليجية، ومنها السعودية كالنجدية، ضمن تغطيتنا لأكثر من 25 لهجة ومتغيّرًا عربيًا، وينتج العمل متحدثون أصليون ولغويون خضعوا للفرز. لا يلمس مساهم بيانات العميل قبل أن يجتاز فرز اللهجة والمجال، ويُعاير العمل على مجموعات ذهبية مع تحكيم وحلقات إعادة عمل وسجل تدقيق لكل مهمة. والاستضافة داخل المنطقة افتراضيًا، مع خيارَي التشغيل داخل مقرّك أو على سحابة خاصة. التفاصيل في توسيم البيانات في السعودية، ولبقية أنواع المهام خدمات توسيم البيانات العربية.
- «سعودية» ليست مواصفة. حدّد الأقاليم والقناة والمستوى اللغوي.
- العلامات موثقة لكنها ميول. «دحين» و«هالحين»، و«وش» و«شنو»، والكاف التي تصير «تس» أو جيمًا، ويلزم وسم للمختلط.
- البيانات المتاحة منحازة. تغريدات وبث تلفزيوني وموارد اصطناعية متزايدة، والجنوبية والشمالية الأضعف تمثيلًا.
- النماذج تنهار نحو لهجة واحدة أو نحو الفصحى. في LabelBench، على الملف الثابت المحجوز، لم يتعرّف نموذج محلي إلا على 4% من الأمثلة الخليجية؛ وصُنّف نحو ثلث إجابات ALLaM-7B-Instruct-preview قبل ضبطه فصحى.
- الموسِّم الأصلي من المنطقة نفسها هو الأساس، مع مجموعة ذهبية وقياس منفصل لكل لهجة.
أسئلة شائعة
كم عدد اللهجات السعودية؟
لا يوجد عدد رسمي، والأبحاث تقسّمها بحسب حاجتها. مدوّنة SDC-5 تعتمد خمس لهجات إقليمية (الحجازية والنجدية والجنوبية والشمالية والشرقية)، ومدوّنة SDCT اكتفت بثلاث لشحّ تغريدات الجنوبية والشمالية، ومجموعة SauDial أربع. عمليًا، حدّد اللهجات التي يتحدث بها مستخدمو منتجك، لا التقسيم الذي يناسب ورقة بحثية.
هل يفهم ChatGPT أو Gemini اللهجة السعودية؟
لا توجد إجابة عامة يمكن الوثوق بها، فالأداء يتغير بالإصدار والمهمة واللهجة. نتائج LabelBench v0.1 شملت نماذج محلية محددة، ولم تشمل واجهات النماذج التجارية الكبرى حتى سبتمبر 2026. الطريق العملي أن تختبر النموذج المرشّح على عينة من بياناتك موزعة على اللهجات المستهدفة، وموسومة بأيدي متحدثين أصليين، وتقرأ النتيجة لكل لهجة على حدة.
هل توجد مجموعة بيانات مفتوحة للهجة السعودية؟
توجد موارد منشورة، لكن رخصها وطبيعتها مختلفة. تُتاح مجموعة SauDial برخصة CC BY على Mendeley Data، لكنها مولّدة بـ GPT-4o ثم منقّحة. ونموذج SaudiBERT منشور على Hugging Face. أما المدوّنات الأخرى فتحقق من رخصة كل منها في ورقتها أو صفحتها قبل أي استخدام تجاري؛ فالنشر في ورقة بحثية لا يعني الإذن بالتدريب.
ما الفرق بين اللهجة السعودية واللهجة الخليجية في توسيم البيانات؟
«الخليجية» في كثير من مخططات تحديد اللهجة إقليم واسع يضم السعودية وجاراتها، ولا يفرّق بين نجدي وحجازي. فإن كان منتجك يخدم مناطق المملكة المختلفة، فالوسم الخليجي وحده يخفي الفروق التي تهمك. وفي المقابل، تشترك اللهجة الشرقية مع دول الخليج المجاورة في مفردات كثيرة، فلا تجعل الحدود السياسية حدودًا لغوية في مخطط الوسوم (Taxonomy).
هل يمكن توليد بيانات اللهجة السعودية اصطناعيًا؟
يمكن، وقد فعلت ذلك دراسات منشورة، لكن التحقق البشري لا غنى عنه. في دراسة Saudi-Dialect-ALLaM بلغت صحة اللهجة في تقييم متحدثين أصليين 68.83% بعد الضبط على بيانات اصطناعية. استخدم التوليد لسد فجوات التغطية، ثم اعرض عينة كافية على متحدثين من كل منطقة. وحدود هذا النهج في مقالنا عن البيانات العربية الاصطناعية (بالإنجليزية).