خدمة · البيانات الصوتية

جمع البيانات الصوتية العربية والتفريغ الصوتي للذكاء الاصطناعي

تسجيلات ونصوص عبر أكثر من 25 لهجة ومتغيرًا عربيًا: مقروءة أو تلقائية، متوازنة بين المتحدثين، ومفرّغة وفق دليل تفريغ موثّق تقيس عليه النتائج.

التفريغ الصوتي للذكاء الاصطناعي هو كتابة الكلام المسجَّل نصًّا وفق قواعد موحّدة، مع الطوابع الزمنية وتمييز المتحدثين، ليصبح بيانات لتدريب أنظمة التعرف التلقائي على الكلام (ASR) وتقييمها، لا مجرد «تحويل الصوت إلى نص». في Bayanat Labs نجمع التسجيلات من متحدثين أصليين اجتازوا التحقق عبر أكثر من 25 لهجة ومتغيرًا عربيًا، ونفرّغها ونوسمها وفق دليل نتفق عليه معك، لفرق المساعدات الصوتية وأنظمة الرد الآلي وتحليلات مراكز الاتصال. البيانات مستضافة داخل المنطقة افتراضيًا، والبداية تجربة محددة النطاق تُنجز عادةً خلال أسبوعين.

ولماذا لا تكفي النماذج الجاهزة؟ على مجموعة اختبار SADA السعودية في لوحة صدارة التعرف على الكلام العربي المفتوحة (نسخة ديسمبر 2024)، سجّل أفضل نموذج مفتوح مُقيَّم معدل خطأ كلمات (WER) قدره 19.2% على الفصحى و48.2% على الخليجية، وقفز خطأ Whisper-large-v3 من 28.0% إلى 59.9%. وفي Casablanca (EMNLP 2024) تراوح خطأ النموذج نفسه دون ضبط إضافي، قبل تطبيع النص، بين 48% للأردنية و87% للموريتانية، وبلغ 62% للإماراتية.

25+لهجة ومتغيرًا عربيًا
داخل المنطقةاستضافة افتراضية، أو داخل مقرّك أو سحابة خاصة
أسبوعانالمدة المعتادة لتجربة محددة النطاق

ماذا نقدّم في جمع البيانات الصوتية وتفريغها وتوسيمها؟

جمع البيانات الصوتية

تسجيلات مقروءة وموجّهة وتلقائية من متحدثين أصليين اجتازوا فحص اللهجة، وفق حصص ومواصفات متفق عليها.

التفريغ الصوتي

نص عربي بطبقتين، حرفية ومنقّحة، مع وسم التردد والضوضاء والتداخل والتبديل اللغوي والبيانات الشخصية.

الطوابع الزمنية والتقطيع

توقيت لكل مقطع أو كلمة (Timestamps)، بأطوال تناسب مسار التدريب لديك.

تمييز المتحدثين

من تكلّم ومتى (Speaker Diarization)، مع تعليم التداخل والفصل بين الموظف والعميل في تفريغ المكالمات.

وسم اللهجة واللكنة والمشاعر

تصنيف لهجة كل متحدث يؤكده مستمع أصلي، مع وسم اللكنة والمشاعر أو النية لكل مقطع.

مجموعات تقييم ASR

اختبارات معزولة مقسّمة حسب اللهجة والقناة وفئة المتحدث، ليُقاس WER لكل شريحة، كما في تقييم نماذج اللغة العربية.

التغطية: اللهجات وقنوات التسجيل والمجالات

لتكون البيانات الصوتية باللهجات العربية ممثِّلة لمستخدميك، سمِّ اللهجات بدقة، كالنجدية والحجازية ولهجة المنطقة الشرقية بدل «سعودية»، وضع داخل كل منها حصصًا للجنس والعمر والقناة. بلا حصص تنجرف البيانات نحو الأسهل تسجيلًا: 92% من متحدثي القسم الفلسطيني في Casablanca رجال، ووجدت لوحة الصدارة أن الخطأ أعلى لدى كبار السن، وأعلى قليلًا لدى النساء، حتى في أفضل النماذج.

واختر نمط الكلام حسب الهدف: المقروء (Scripted) للأوامر والأرقام، والتلقائي (Spontaneous) لمتانة ASR وهو الأعلى كلفةً في التفريغ. وسجّل على قناة الإنتاج نفسها: هاتف أو تطبيق أو التقاط بعيد (Far-field). وفي المجالات المصرفية والطبية والقانونية يراجع المصطلحات مختصون مرخّصون.

قواعد التفريغ الصوتي للذكاء الاصطناعي: اللهجات والتبديل اللغوي

لا إملاء رسميًا للهجات العربية، فيصير دليل التفريغ جزءًا من نموذجك. في تحدي MGB-3 كتب أربعة مفرّغين الكلام المصري كلٌّ بطريقته، وبعد توحيد أشكال الألف والياء والهاء بقي بينهم خلاف في نحو 13% من الكلمات، وهو ضجيج في التدريب وفي قياس WER. وإرشادات CODA* لـ28 لهجة مدينية من الرباط إلى مسقط، منها الرياض وجدة، أساس جيد لمعجم المشروع. هذه أهم القرارات:

القرارالخيار أالخيار بالافتراض المعقول
التردد والبدايات المتعثرةحرفي: «يعني… اه… كنت، كنت أبي أروح البنك»منقّح: «كنت أبي أروح البنك»حرفي مع وسوم التردد لتدريب ASR، ومنقّح للتحليلات
الأصوات اللهجيةصوتي: «گال»، «شلونچ»اصطلاحي: «قال»، «شلونك»الإملاء الاصطلاحي، والصوتي لأعمال النطق فقط
حدود الكلمات والهمزات«مافيه»، «ابغى»«ما فيه»، «أبغى»شكل واحد يوثَّق في المعجم، وتوحيد قبل حساب WER
التبديل اللغوي (Code-switching)«عندي meeting بكرة»«عندي ميتنق بكرة»اللاتيني بوسم لغة، وطبقة عربية عند الحاجة
الأرقام«أبي أحوّل ألفين ريال»«أبي أحوّل 2000 ريال»كلمات في الطبقة الحرفية لأنها تُصرَّف (ألفين/ألفان)
البيانات الشخصيةطبقة مقيّدة الوصول«رقم جوالي [PHONE]»وسم في النص وكتم في الصوت المشترك

والتبديل اللغوي تحدٍّ قائم بذاته: أظهرت مجموعة Mixat للكلام الإماراتي المختلط بالإنجليزية تعثّر النماذج الحالية فيه.

كيف يسير مشروع البيانات الصوتية؟

  1. تحديد النطاق. نحدد معًا اللهجات وحصص المتحدثين والقناة والمجال وصيغة الموافقة ومواصفات التسجيل والتسليم.
  2. الدليل والمجموعة المرجعية. نكتب دليل التفريغ ومعجم اللهجة، ويفرّغ لغويون أصليون مقاطع مرجعية (Gold Set) ويحكّمونها، ولا يلمس مفرّغ بياناتك قبل اجتياز فحص اللهجة والتدريب عليها.
  3. التجربة. شريحة ثابتة تُنجز كاملة، مع تقرير جودة حسب اللهجة.
  4. ضبط الجودة والتحكيم. استماع ثانٍ وفحوص مرجعية وتحكيم يغذّي إعادة العمل وتحديث الدليل.
  5. التوسع والتسليم. دفعات من الصوت والنصوص والطوابع الزمنية وبيانات المتحدثين، بسجل تدقيق لكل مهمة. هذه منهجيتنا: التحقق ← التدريب ← الإنتاج ← ضبط الجودة ← التسليم.

كيف نضبط جودة التفريغ الصوتي؟

نفحص الصوت أولًا بحثًا عن التشبّع (Clipping) والصمت والقناة أو المتحدث الخطأ، ويؤكد مستمع أصلي لهجة كل متحدث. تدخل مقاطع مرجعية في قائمة كل مفرّغ وتُقاس بمعدل WER بعد التطبيع، وتُفرَّغ نسبة من المقاطع مرتين باستقلال ليُقاس الاتفاق بين المفرّغين (Inter-Annotator Agreement) لا ليُفترض. الخلافات تذهب إلى التحكيم وإعادة العمل، والمتكرر منها يدخل المعجم. ويعرض تقرير الجودة المنهجية ونتائجها على بياناتك أنت، لا أرقام دقة عامة.

متى يكفي التفريغ الآلي ومتى تحتاج مفرّغين بشريين؟

بمعدلات الخطأ السابقة يصير «التصحيح» إعادة كتابة، فاختبر أي نموذج على عيّنة مرجعية أولًا.

الحالةالنهج المناسب
نموذج أثبت قوته على لهجتك وقناتك في عيّنة مرجعيةمسودة آلية وتصحيح بشري، مع تدقيق عيّنات
لهجة محلية أو مكالمات هاتفية أو تبديل لغوي كثيفتفريغ بشري من الصفر، والآلة للتقطيع والتوقيت فقط
وسم اللهجة وبيانات المتحدثتحقق بشري دائمًا
مجموعات الاختبارتفريغ بشري مزدوج مع تحكيم، بلا مسودات آلية

ووسم اللهجة يبقى بشريًا: في LabelBench لم تتجاوز دقة النموذج اللغوي الصغير Qwen 2.5 3B ‏22.4% في تمييز خمس مناطق لهجية من النص، أي أعلى بقليل من التخمين العشوائي (20%)، وصنّف 75% من الأمثلة الخليجية على أنها مصرية. ومقياس «التغطية الآلية الآمنة» (Safe Automation Coverage) يحدد القاعدة: لا يخرج من المراجعة البشرية إلا ما يثبت إحصائيًا بقاؤه فوق حد الجودة الذي تحدده.

الخصوصية والموافقة وإقامة البيانات الصوتية

بحسب المادة الأولى من نظام حماية البيانات الشخصية السعودي، يُعدّ التسجيل الذي قد يؤدي إلى معرفة صاحبه بيانات شخصية، وتُعدّ البيانات الحيوية المستخدمة لتحديد الهوية بيانات حساسة بشروط أشد. لذا نتفق على صيغة الموافقة والغرض قبل التسجيل، ونوسم البيانات الشخصية في المكالمات أو نحجبها. الاستضافة داخل المنطقة افتراضيًا، أو داخل مقرّك (On-prem) أو في سحابة خاصة، بأدنى صلاحيات لازمة وسجلات تدقيق، وجميع المساهمين ملتزمون باتفاقيات عدم إفصاح (NDA). راجع قائمة تحقق PDPL وإقامة البيانات (بالإنجليزية) وصفحة «شركة توسيم بيانات في السعودية».

حالات الاستخدام حسب القطاع

  • الاتصالات والقطاع الحكومي: الرد الصوتي التفاعلي (IVR) والمساعدات الصوتية، مختبرة لكل لهجة.
  • المصارف والتمويل: تفريغ المكالمات مع تمييز المتحدثين ووسم البيانات الشخصية والنية.
  • الصحة والقانون: الإملاء الطبي والجلسات والمقابلات، بمراجعة أطباء ومحامين مرخّصين.
  • الإعلام والتجزئة: الترجمة النصية المصاحبة والبحث والتسوق بالصوت.

فريق داخلي أم منصة جماعية أم مزوّد متخصص؟

المعيارفريق داخليمنصة جماعيةمزوّد متخصص
التحقق من اللهجةفي حدود لهجات موظفيكغالبًا بتصريح المتحدث نفسهفحص متحدثين أصليين لكل لهجة
دليل التفريغتحكّم كامل وصيانته عليكعام ويتباين بين العاملينمعجم خاص بالمشروع يُحدَّث معك
يناسبنطاقات صغيرة شديدة الحساسيةكلام مقروء كبير الحجم وبسيطكلام لهجي أو حواري أو خاضع للتنظيم

ابدأ بتجربة محددة النطاق

اختر لهجة أو اثنتين وقناة واحدة. للتجربة نطاق ثابت يشمل الجمع أو التفريغ وضبط الجودة بمجموعة مرجعية وتقرير جودة حسب اللهجة، وتُنجز عادةً خلال أسبوعين، ثم تتوسع بنموذج مُدار أو فريق مدمج أو تعاقد مؤسسي. والفريق نفسه يتولى توسيم البيانات العربية وبيانات RLHF. للخلفية اقرأ دليل توسيم البيانات العربية أو تصفّح مقالاتنا بالعربية، أو تواصل معنا.

تبحث عن عمل في التفريغ الصوتي؟ تجد فرص العمل المرنة عن بعد في شبكة المواهب ودليل وظائف توسيم البيانات.

أسئلة شائعة

كم ساعة من البيانات الصوتية أحتاج لتدريب نموذج على اللهجة السعودية؟

لا يوجد رقم ثابت، فالأمر يتوقف على بُعد النموذج الأساسي عن لهجتك وقناتك. ابدأ بمجموعة اختبار صغيرة مقسّمة حسب اللهجة، وأضف البيانات على دفعات مع القياس بعد كل دفعة. ساعات قليلة متوازنة من اللهجة الصحيحة وعلى القناة الصحيحة تفيد غالبًا أكثر من ساعات طويلة من لهجة أخرى.

هل تكفي مجموعات البيانات الصوتية العربية المفتوحة؟

تفيد في التدريب المسبق والمقارنة المعيارية، ونادرًا ما تكفي وحدها. مجموعة SADA مثلًا تضم 668 ساعة من برامج تلفزيونية سعودية، وصوت البث بعيد عن مكالمة عميل على خط هاتفي. تحقّق من رخصة الاستخدام التجاري لكل مجموعة، ثم سُدّ الفجوات المقيسة بجمع موجّه.

هل يجب تشكيل النص في التفريغ الصوتي لتدريب ASR؟

في معظم مشاريع ASR لا، فالعربية اليومية تُكتب بلا حركات، والتشكيل الكامل يرفع الكلفة ويفتح بابًا جديدًا للخلاف بين المفرّغين. الاستثناء بيانات تحويل النص إلى كلام (TTS) وأعمال النطق. وبعض المشاريع تحتفظ بالتنوين والهمزة، كما فعلت Casablanca. المهم أن يُكتب القرار في الدليل.

ما صيغة الملفات ومعدل أخذ العيّنات المناسبان للبيانات الصوتية؟

طابِق قناة التشغيل. الصوت الهاتفي ضيّق النطاق، عادةً 8 كيلوهرتز، فنماذج مراكز الاتصال تحتاج مكالمات حقيقية لا تسجيلات استوديو خُفّضت جودتها. صوت التطبيقات عادةً 16 كيلوهرتز أو أعلى، وبيانات TTS تحتاج استوديو. اطلب صيغة غير فاقدة مثل WAV أو FLAC، وقناة لكل متحدث متى أمكن.

ابدأ تجربة بيانات صوتية عربية

أخبرنا باللهجات المستهدفة وقناة التسجيل وحالة الاستخدام، وسنقترح تجربة محددة النطاق تشمل دليل تفريغ مكتوبًا وضبط جودة بمجموعة مرجعية وتقرير جودة، تُنجز عادةً خلال أسبوعين.

اطلب تجربة صوتية