معايير التفريغ الصوتي للهجات العربية: قواعد الكتابة والوسوم لتدريب نماذج الكلام
اللهجات بلا إملاء رسمي، فكل مفرّغ يكتبها على طريقته، ويتعلم النموذج هذا التشتت. دليل أسلوب عملي لتفريغ الكلام العربي بيانات تدريب: ماذا يُكتب، وكيف، وبأي وسم.
معايير التفريغ الصوتي لبيانات تدريب نماذج الكلام هي قواعد مكتوبة تحدد كيف يُحوَّل كل ما يُسمع إلى نص موحّد: أيّ إملاء للكلمات العامية، وكيف تُكتب الكلمات الإنجليزية والأرقام، وما الوسوم التي تعلّم التأتأة والضحك والضوضاء، وأين تبدأ المقاطع وتنتهي ومن المتكلم. القاعدة الأساسية: اكتب ما قيل لا ما ينبغي أن يُقال، بإملاء واحد يلتزمه كل المفرّغين. فالتفريغ الصوتي (Transcription) لتدريب أنظمة التعرف على الكلام (ASR) ليس محضر اجتماع، وكل تناقض فيه يتعلمه النموذج.
كثير من أدلة التفريغ العربية المتاحة تنصح بتحويل العامية إلى فصحى سليمة، وهذا عكس ما تحتاجه بيانات التدريب. ما يلي هو المعايير التي نوصي بها، مبنية على: إرشادات اتحاد البيانات اللغوية LDC لتفريغ البث العربي (الإصدار 3، 2012)، وإرشادات CODA* الموحدة لإملاء اللهجات، ودليل مجموعة Casablanca (EMNLP 2024).
التفريغ الحرفي أم المنقح: أيهما لبيانات التدريب؟
التفريغ الحرفي (Verbatim) يكتب كل ما نُطق: التكرار والبدايات المتعثرة وأصوات التردد، مع وسوم للضحك والضوضاء. والتفريغ المنقح (Clean Verbatim) يحذف ذلك ويبقي الكلام كما هو، بلا إعادة صياغة أو تحويل إلى الفصحى. وتنص إرشادات LDC على نسخة حرفية لكل الكلام، وعلى عدم تصحيح الأخطاء النحوية: يُكتب ما قاله المتحدث لا ما يتوقع المفرّغ سماعه.
| الاستخدام | النوع المناسب | السبب |
|---|---|---|
| تدريب ASR وتقييمه | حرفي مع وسوم | النموذج يسمع التردد والتكرار، ويجب أن يرى في النص ما يقابلهما |
| تحليلات مراكز الاتصال وتصنيف النوايا | منقح | الحشو يشوّش على المصنِّف ولا يضيف معنى |
| التلخيص والبحث في التسجيلات | منقح | القارئ يحتاج المحتوى لا الأداء |
| أبحاث الطلاقة والنطق | حرفي مفصّل | التأتأة هي موضوع الدراسة |
والأوفر غالبًا: فرّغ حرفيًا مرة واحدة، واشتق المنقح آليًا بقواعد مكتوبة تحذف الوسوم وأصوات التردد والكلمات المبتورة. أما العكس فمستحيل دون إعادة الاستماع.
كيف تكتب الكلمات العامية بشكل موحد في التفريغ؟
لا يوجد إملاء رسمي لأي لهجة عربية. رصدت ورقة CODA* سبعًا وعشرين كتابة فعلية على الإنترنت لكلمة مصرية واحدة هي «مبيقولهاش» (لا يقولها). وفي تحدي MGB-3 فرّغ أربعة مفرّغين الكلام المصري نفسه كلٌّ بطريقته، وبعد توحيد الألف والياء والهاء بقي بينهم خلاف في نحو 13% من الكلمات على بيانات التطوير. وهذا ضجيج في التدريب وخطأ زائف في قياس WER. ولكتابة اللهجات العامية في التفريغ ثلاث قواعد:
- اكتب اللهجة كما قيلت، ولا تحوّلها إلى فصحى. تمنع إرشادات LDC تحويل «اللي» إلى «الذي» أو «انو» إلى «أنه». فـ«أبغى» تبقى «أبغى»، و«عايز» تبقى «عايز».
- لا تكتب اللكنة. القاف التي تُنطق /g/ في الخليج وهمزةً في القاهرة تُكتب قافًا، والثاء التي تُنطق تاءً في مصر تُكتب ثاءً. هذه قاعدة الأصل الاشتقاقي في CODA*: الحرف الذي له مقابل في الفصحى بتحوّل صوتي منتظم يُكتب بحرف الفصحى. فتُكتب «أقدر» لا «أگدر»، و«بيقول» لا «بيأول»، و«ثلاثة» لا «تلاتة». أما الكتابة الصوتية بحروف مثل «گ» و«چ» فتُترك لمشاريع النطق وحدها.
- ابنِ معجمًا للمشروع (Project Lexicon). لكل كلمة متكررة يختلف إملاؤها صيغة واحدة معتمدة: «ما فيه» أم «مافيه»؟ «إيش» أم «ايش»؟ «مدرسة» أم «مدرسه»؟ ويضاف إلى المعجم كل ما يختلف عليه المفرّغون.
ولماذا تحدد تغطية اللهجات سقف نموذجك، تجده في مقالتنا عن الفصحى واللهجات (بالإنجليزية).
الكلمات الإنجليزية داخل الكلام العربي: حروف عربية أم لاتينية؟
التبديل اللغوي (Code-switching) شائع في كلام كثير من المتحدثين الخليجيين، وهو نقطة ضعف للنماذج: أظهرت مجموعة Mixat للكلام الإماراتي المختلط بالإنجليزية (15 ساعة) قصور أنظمة ASR العربية ومتعددة اللغات الجاهزة فيه. ونوصي بالتمييز بين حالتين:
- الكلمة الدخيلة المستقرة تُكتب بالحروف العربية، خاصة إذا دخلتها أداة التعريف أو الضمائر أو الجمع العربي: «الأوردر بتاعي»، «الإيميل حقي». وهذه قاعدة LDC أيضًا: «كمبيوتر» و«تلفزيون» تُكتبان بالعربية.
- العبارة الأجنبية غير المندمجة تُكتب بحروفها اللاتينية: «عندي meeting بعد الظهر». تعلّمها LDC بوسم لغة من نوع <foreign lang="English">. وإن كانت الإنجليزية الأجنبية الوحيدة في مشروعك، فالحرف اللاتيني نفسه علامة كافية، والوسم لازم حين تظهر الفرنسية أيضًا.
وطلبت Casablanca نسختين للمقاطع المختلطة، بالحروف العربية وباللاتينية، وهو حل مكلف يحفظ الخيارين. المهم أن تُحسم القاعدة قبل البدء، لأن «ميتنق» و«meeting» في مجموعة واحدة كلمتان مختلفتان عند حساب WER.
كيف تُكتب الأرقام والتواريخ والأسماء في التفريغ؟
- الأرقام بالكلمات كما نُطقت. هذه قاعدة LDC وCasablanca معًا، لأن العدد العربي يتصرف: «ألفين ريال» في الخليج غير «ألفا ريال» في نشرة الأخبار. أما الصيغة الرقمية فتُشتق لاحقًا في النسخة المنقحة.
- أرقام الجوال والحسابات تُكتب خانةً خانة كما قيلت، ثم توسم بياناتٍ شخصية أو تُحجب. وتعامل معها وفق قائمة التحقق لنظام حماية البيانات الشخصية وإقامة البيانات (بالإنجليزية).
- الاختصارات: ما يُنطق كلمة واحدة يُكتب كما يُنطق («ناسا»)، وما يُنطق حرفًا حرفًا تُكتب حروفه منفصلة كما نُطقت، على نحو «إي تي إم».
- أسماء الأعلام بلا وسم، وبإملاء واحد في الملف كله يطابق اسم المتحدث في تسمية المقاطع، وفق LDC، ومكانها معجم المشروع.
التأتأة وأدوات الحشو: هل تُكتب «يعني» و«أه»؟
فرّق بين نوعين. أصوات التردد (Filled Pauses) ليست كلمات، ولذلك تحصرها LDC في قائمة مغلقة بإملاء ثابت: «أه، إيه، أم، أوو، مم». ولا تُمدّ لتعكس طول الصوت («أهههه»). أما «يعني» و«طيب» و«خلاص» فكلمات حقيقية تُكتب في النسخة الحرفية دائمًا. وتحذفها النسخة المنقحة حين تكون حشوًا فقط، لا حين تحمل معنى، كما في «يعني إيش؟».
والكلمة المبتورة تُكتب بقدر ما نُطق منها، وتلحقها شرطة: «أ- أغيّر». أما التكرار فيُكتب كما وقع: «كنت، كنت أبغى». والجملة التي انقطعت قبل تمامها تنتهي بشرطتين «--» بحسب LDC.
ما وسوم الأصوات غير الكلامية المعتمدة في التفريغ؟
مجموعة وسوم نوصي بها، معظمها من إرشادات LDC. ونفضّل الوسوم اللاتينية بين أقواس لأنها تُحذف آليًا بسهولة قبل حساب WER ولا تلتبس بالكلمات العربية:
| الظاهرة | الوسم | مثال | ملاحظة |
|---|---|---|---|
| أصوات يصدرها المتحدث | {laugh} {cough} {sneeze} {lipsmack} | ما أقدر أجي {cough} الصبح | الوسوم الأربعة من LDC، ويمكن إضافة {breath} |
| ضوضاء الخلفية والموسيقى | [noise] [music] | [music] أهلًا بكم في… | LDC لا تشترطها، ونوصي بها لبيانات الهاتف والتطبيقات |
| كلام غير مفهوم | (( )) | بقالي (( )) مستنية | لا تتجاوز المقطع ولا تخمّن دون علامة |
| كلام مسموع بشك | ((الكلمة)) | اتصلت على ((فرع العليا)) | يكتب المفرّغ أقرب ما سمع بين قوسين مزدوجين |
| كلمة مبتورة | شرطة ملتصقة | أ- أغيّر | من LDC |
| نطق خاطئ واضح | + قبل الكلمة | +جغرافية | للخطأ الفردي فقط، لا لنطق اللهجة |
| جملة غير مكتملة | -- | كنت أبي أقول لك إن -- | من LDC |
| كلام متداخل | [overlap] | مقطع لكل متحدث بأزمنته | الأفضل مقاطع متداخلة الأزمنة، والوسم حين تكون القناة واحدة |
| بيانات شخصية | [PII:PHONE] [PII:NAME] | رقمي [PII:PHONE] | في النسخة المشتركة، مع كتم الصوت المقابل |
التقطيع والطوابع الزمنية وتمييز المتحدثين
التقطيع (Segmentation): اقطع عند الوقفات وتغيّر المتحدث. واشترطت Casablanca في مقاطعها متحدثًا واحدًا، وثلاث كلمات على الأقل، وألا يتجاوز المقطع 30 ثانية، وأن تُحفظ الكلمتان الأولى والأخيرة كاملتين. وتُبقي LDC فترات الصمت أو الضوضاء القصيرة (أقل من نصف ثانية) داخل المقطع ولا تفصلها.
الطوابع الزمنية (Timestamps): تسجّلها LDC بالثواني مقرّبة إلى جزء من ألف. ويكفي في الغالب طابع لكل مقطع لتدريب ASR، ويُترك التوقيت لكل كلمة لمن يحتاجه.
تمييز المتحدثين (Speaker Diarization): لكل متحدث في الملف معرّف فريد ثابت، مثل spk1 وspk2، لا يُعاد استخدامه لشخص آخر في الملف نفسه، وهذه قاعدة LDC. وفي المكالمات أضف الدور (موظف أو عميل)، واحفظ لكل متحدث لهجته وجنسه وقناته. واللهجة يؤكدها مستمع من أهلها: في LabelBench، وعلى مجموعة التقييم المحجوزة الثابتة، بلغت دقة المطابقة التامة لنموذج لغوي محلي في تمييز خمس مناطق لهجية من النص 22.4%، مقابل 20% للتخمين العشوائي.
مثالان من مكالمات خليجية ومصرية
المثالان توضيحيان، كُتبا لشرح القواعد لا من بيانات حقيقية. مكالمة خليجية (عميل يطلب تغيير موعد):
- الحرفي: spk2 (عميل) [00:00:03.120–00:00:08.940]: أه… يعني أبغى أ- أغيّر موعدي حق بكرة {cough} لأني ما أقدر أجي الصبح، عندي meeting
- المنقح: أبغى أغيّر موعدي حق بكرة لأني ما أقدر أجي الصبح، عندي meeting.
لاحظ: «أقدر» بالقاف وإن نُطقت /g/، و«يعني» حشو هنا فحُذفت من المنقح، و«حق» الخليجية باقية كما هي.
مكالمة مصرية (عميلة تسأل عن طلب متأخر):
- الحرفي: spk1 (عميلة) [00:01:12.400–00:01:19.050]: أيوه، أنا عايزة أعرف الأوردر بتاعي فين، بقالي ثلاث أيام مستنية {laugh} والرسالة بتقول out for delivery
- المنقح: أيوه، أنا عايزة أعرف الأوردر بتاعي فين، بقالي ثلاث أيام مستنية، والرسالة بتقول out for delivery.
لاحظ: «ثلاث» بالثاء و«بتقول» بالقاف رغم النطق المحلي، و«الأوردر» بالعربية لأنها دخلتها أداة التعريف، و«أيوه» كلمة لا صوت تردد فتبقى في المنقح.
دليل معايير التفريغ الصوتي المختصر: عشر قواعد قابلة للنسخ
- فرّغ حرفيًا، ولا تصحح النحو ولا تحوّل العامية إلى فصحى.
- الحرف الذي له أصل فصيح يُكتب بإملائه لا بنطقه المحلي (ق، ث، ج، ذ).
- التزم معجم المشروع، وأضف إليه كل خلاف جديد.
- الدخيل المستقر بالعربية، والأجنبي غير المندمج باللاتينية.
- الأرقام بالكلمات كما نُطقت، وأرقام الهواتف خانةً خانة بوسم [PII].
- أصوات التردد من القائمة المغلقة فقط: أه، إيه، أم، أوو، مم.
- الكلمة المبتورة بشرطة ملتصقة، والجملة المنقطعة بشرطتين.
- أصوات المتحدث بين أقواس معقوفة، والضوضاء بين أقواس مربعة، وغير المفهوم بين قوسين مزدوجين.
- مقطع لمتحدث واحد لا يتجاوز 30 ثانية، بطوابع بالميلي ثانية ومعرّف ثابت للمتحدث.
- التشكيل غير مطلوب، إلا ما يقرره الدليل صراحة، كالتنوين والهمزات التي شجّعت Casablanca على كتابتها. وأي قاعدة غير مكتوبة ستُطبَّق بطريقتين.
وكيف يُدار المشروع كله، من الدليل إلى المجموعة الذهبية (Gold Set) وقياس الاتفاق، تجده في دليل توسيم البيانات العربية.
في Bayanat Labs بالرياض نتعامل مع التفريغ الصوتي على أنه توسيم للبيانات لا طباعة: تفريغ حرفي وطوابع زمنية وتمييز للمتحدثين ووسم للهجة واللكنة، ينجزه متحدثون أصليون اجتازوا فرزًا في اللهجة والمجال، عبر أكثر من 25 لهجة وتنويعة عربية. ويُعايَر العمل على مجموعات مرجعية مع تحكيم وإعادة عمل، ولكل مهمة سجل تدقيق، وتُستضاف البيانات داخل المنطقة افتراضيًا. ونبدأ بمشروع تجريبي بنطاق ثابت، يُنجَز عادةً خلال أسبوعين، ومعه تقرير جودة. التفاصيل في صفحة جمع البيانات الصوتية العربية والتفريغ الصوتي.
- فرّغ حرفيًا واشتق المنقح. ما يُحذف في التفريغ لا يُستعاد دون إعادة الاستماع.
- اكتب اللهجة لا اللكنة. «أبغى» و«عايز» كما قيلتا، و«أقدر» بالقاف.
- احسم الإنجليزية والأرقام قبل البدء. «ميتنق» و«meeting» كلمتان مختلفتان عند حساب WER.
- وسوم قليلة قابلة للحذف آليًا، ومعرّف ثابت لكل متحدث.
أسئلة شائعة
كيف تُقاس جودة التفريغ الصوتي العربي؟
بمعدل خطأ الكلمات (WER) بين تفريغ المفرّغ وتفريغ مرجعي حكّمه لغوي، بعد تطبيق التوحيد الإملائي نفسه على الطرفين، وإلا عُدّ اختلاف الهمزة خطأً. ولأن الخلاف الإملائي في اللهجات لا يزول كله، استخدم تحدي MGB-3 أربعة تفريغات مرجعية لكل مقطع، ومعدل خطأ متعدد المراجع (MR-WER). وافصل النتيجة حسب اللهجة والقناة، فالمتوسط يخفي الشريحة المتعثرة.
هل أستخدم Whisper لإنتاج مسودة أولى ثم أصححها؟
اختبره أولًا على عينة مرجعية من تسجيلاتك. إن كان خطؤه على لهجتك وقناتك منخفضًا، فالتصحيح أسرع من الكتابة. وإن كان مرتفعًا، صار التصحيح إعادة كتابة، وورث المفرّغ أخطاء المسودة. وفي تقييم Casablanca لم ينتج whisper-large-v3 أي كلمة بالحروف اللاتينية في المقاطع المختلطة، فكانت مخرجاته نقحرة أو ترجمة. ولا تستخدم المسودات الآلية في مجموعات الاختبار.
ما الفرق بين التفريغ الصوتي والترجمة النصية للفيديو؟
الترجمة النصية المصاحبة (Subtitles) موجهة للمشاهد: تُختصر الجمل لتناسب سرعة القراءة، وتُحذف التكرارات، وقد تُكتب بالفصحى وإن كان الكلام بالعامية. أما التفريغ لتدريب نماذج الكلام فموجه للنموذج: يطابق المنطوق كلمة بكلمة، ويحمل وسومًا وطوابع زمنية دقيقة. لذلك تحتاج ترجمات البرامج عادةً إلى مواءمة مع الصوت أو فلترة قبل أن تصلح بيانات تدريب لـASR.
أبحث عن عمل في التفريغ الصوتي العربي، من أين أبدأ؟
إن كنت تتقن لهجتك وتكتب بدقة، فاقرأ مقالتنا عن وظائف توسيم البيانات وتدريب الذكاء الاصطناعي عن بعد، ثم قدّم مجانًا عبر شبكة Bayanat للمواهب: عمل مرن عن بعد ومدفوع لكل مهمة، يبدأ باجتياز فرز في اللهجة والمجال.