قائمة فحص · الرؤية والنماذج متعددة الوسائط

كيف تدقّق مجموعة بيانات صور وفيديو عربية لنموذج متعدد الوسائط: 10 فحوص

اختر العينة بنفسك، وافتح الصور والمقاطع، وقيّمها بندًا بندًا. يغطي هذا الدليل تمثيل المنطقة، وهل يمكن فعلًا قراءة النص العربي في كل صورة، واتساق الوسوم، وملاءمة المهمة، وموافقات الجمع، وتسرّب البيانات إلى مجموعة الاختبار، مع موارد عامة للمقارنة.

فريق أبحاث Bayanat Labs· · 16 دقيقة قراءة · Read in English

لتدقيق مجموعة بيانات صور أو فيديو عربية لنموذج متعدد الوسائط (multimodal model)، اختر بنفسك عينة من بضع مئات من الصور أو المقاطع، واطلب من قرّاء ناطقين بالعربية إعادة توسيم جزء منها، ثم قيّم عشرة أمور كلٌّ على حدة: ملاءمة المهمة، وتمثيل المنطقة، وظروف الالتقاط، وقابلية قراءة النص العربي في كل صورة، وقواعد التفريغ النصي، وأدلة الإسناد المرئي، واتساق الوسوم، وتوقيت الفيديو، والموافقات والحقوق، وتسرّب البيانات بين التدريب والاختبار. لا تقبل رقم دقة واحدًا مجمّعًا؛ فالبيانات البصرية العربية تخفق في مواضع محددة: لافتة مفرّغة بترتيب معكوس، أو إجابة لا تدعمها الصورة، أو واجهة المتجر نفسها في مجموعتي التدريب والاختبار معًا.

هذا الدليل لفرق نماذج الرؤية واللغة والنماذج متعددة الوسائط في الإمارات والسعودية وغيرهما التي تشتري بيانات صور وفيديو عربية أو ترخّصها أو تبني عليها: مشاهد الشوارع والمتاجر، والعبوات، وقوائم الطعام، واللافتات، والتعليمات، وتسجيلات الفيديو المصرّح بها. أما المستندات الممسوحة والفواتير والاستمارات فلها دليل مستقل هو تقييم بيانات OCR العربية، لأنها تحتاج فحوصًا خاصة لترتيب القراءة والحقول والجداول.

أهم النقاط
  • ابدأ من المهمة. الأوصاف، وقراءة النص في المشهد، والإجابة المستندة إلى أدلة مرئية، وأحداث الفيديو، تحتاج كلٌّ منها وسومًا مختلفة، ونادرًا ما تصلح مجموعة بُنيت لمهمة لغيرها.
  • اسأل أين جُمعت، لا كم عددها فقط. اطلب عدد الدول والمدن والبيئات وأجهزة الالتقاط؛ فالمجموعة التي جُمعت في مكان آخر لن تُظهر لافتات مستخدميك ورفوفهم وعبواتهم.
  • كل إجابة تحتاج دليلًا مرئيًا. إذا أمكن الإجابة عن السؤال دون النظر إلى الصورة، فهو يختبر النموذج اللغوي لا قدرات الرؤية.
  • الموافقات وتقسيم البيانات يحددان إمكانية الإطلاق. الأشخاص والوجوه ولوحات السيارات بيانات شخصية، والمشاهد شبه المكررة بين التقسيمات تضخّم كل النتائج.

لماذا تحتاج البيانات البصرية العربية تدقيقًا خاصًا؟

تُظهر المعايير العامة أن النماذج الحالية ما زالت تتعثر في المحتوى البصري العربي، لذلك يجب أن تكون بيانات تدريبها واختبارها صحيحة في مواضع الإخفاق تحديدًا. فمعيار CAMEL-Bench (Ghaboura وزملاؤه، 2024)، الذي يضم نحو 29,036 سؤالًا عربيًا في ثمانية مجالات و38 مجالًا فرعيًا تشمل فهم الصور المتعددة والفيديو، يذكر أن GPT-4o نفسه لم يحقق سوى 62% في النتيجة الإجمالية. ووجد معيار JEEM (Kadaoui وزملاؤه، 2025)، الذي يختبر وصف الصور والإجابة عن الأسئلة البصرية بلهجات الأردن والإمارات ومصر والمغرب، أن النماذج العربية الخمسة مفتوحة المصدر للرؤية واللغة التي قيّمها جاء أداؤها أضعف باستمرار، وأنها عانت في الفهم البصري وفي التوليد الخاص باللهجات معًا، وأن حتى أفضلها، GPT-4V، تفاوتت كفاءته اللغوية بين اللهجات وتأخر في الفهم البصري.

ثلاث حقائق تقف وراء معظم الفحوص التالية:

  • مكان التقاط الصورة يغيّر ما يراه النموذج. وجدت دراسة DeVries وزملائه (2019) أن أنظمة تجارية للتعرف على الأشياء كان أداؤها ضعيفًا نسبيًا على الأدوات المنزلية الشائعة في الدول التي ينخفض فيها دخل الأسر، ويشير تحليلها النوعي إلى أن ذلك يرجع أساسًا إلى اختلاف مظهر الأشياء داخل الفئة الواحدة وظهورها في سياق مختلف.
  • النص العربي في المشاهد مختلط وصعب القراءة غالبًا. تجمع اللافتات والعبوات وقوائم الطعام بين العربية والحروف اللاتينية والأرقام في الإطار نفسه، مع الانعكاس والزاوية والمسافة. ويحفظ Unicode النص العربي بترتيب القراءة، ثم تعيد خوارزمية الاتجاه الثنائي ترتيبه عند العرض، فقد يبدو النص المصدَّر بترتيب العرض سليمًا في أداة لا تطبّق الخوارزمية وهو محفوظ معكوسًا.
  • بيانات الاختبار تتسرّب. وجد Barz وDenzler أن 3.3% من صور اختبار CIFAR-10 و10% من صور اختبار CIFAR-100 لها نسخ شبه مكررة في مجموعة التدريب، ورصد Song وزملاؤه (Findings of EMNLP 2025) تلوثًا كبيرًا في اثني عشر نموذجًا لغويًا كبيرًا متعدد الوسائط وخمسة معايير، لا سيما في النماذج المغلقة والمعايير الأقدم.

الفحوص العشرة لمجموعات بيانات الصور والفيديو العربية

طبّق كل الفحوص على العينة نفسها، على أن تختارها أنت لا المورّد، وتوزّعها حسب نوع المشهد والموقع وظروف الالتقاط. الإخفاق في الفحوص 1 أو 2 أو 6 أو 9 أو 10 ينهي التقييم في الغالب، أما البقية فيمكن غالبًا أن يعالجها المورّد بتعديل المواصفات وإعادة التسليم.

#الفحصطريقة الفحصعلامة الخطر
1ملاءمة المهمةاربط كل نوع من الوسوم بالسلوك المطلوب في بيئة الإنتاج: قراءة نص، أو إجابة سؤال، أو تحديد موضع الدليل، أو وصف مشهد، أو تتبّع حدث في فيديو.أوصاف فقط وأنت تحتاج إجابات مستندة إلى منطقة محددة؛ أسئلة إنجليزية مترجمة آليًا إلى العربية.
2تمثيل المنطقةاطلب بيانات وصفية عن التقاط كل صورة: الدولة والمدينة والبيئة (شارع، مركز تسوّق، صيدلية، سوبرماركت، مواصلات) والمصدر، وقارنها بأماكن مستخدميك.عدد إجمالي للصور فقط؛ صور جاهزة (stock) مجمّعة من الويب؛ مدينة واحدة تمثّل «العالم العربي» كله.
3ظروف الالتقاطافحص تنوّع الإضاءة والمسافة والزاوية وضبابية الحركة والانعكاس على الزجاج والعبوات والتصوير الليلي وأنواع الأجهزة.صور نظيفة جيدة الإضاءة ملتقطة من الأمام فقط، بينما يوجّه مستخدموك هواتفهم إلى الرفوف واللافتات.
4قابلية قراءة النص العربياطلب لكل منطقة نصية علامة وضوح (مقروء، مقروء جزئيًا، غير مقروء) ووسمًا للكتابة (عربية، لاتينية، مختلطة). اقتطع 50 منطقة واقرأها بنفسك.تفريغ كامل لنص لا يستطيع أي قارئ تمييزه؛ لا سبيل لاستبعاد المناطق غير المقروءة من التقييم.
5قواعد التفريغ النصيتحقق من حفظ النص بالترتيب المنطقي (ترتيب القراءة)، والأرقام كما طُبعت، والحروف بترميز Unicode القياسي لا بأشكال العرض (presentation forms)، وهي الفحوص نفسها في دليل تقييم بيانات OCR.نصوص معكوسة مثل ةيلديص بدل صيدلية؛ تحويل الأرقام الهندية (٠–٩) إلى أرقام أخرى دون تنبيه.
6أدلة الإسناد المرئيفي أزواج الأسئلة والأجوبة والأوصاف، تحقق من أن كل إجابة تشير إلى مربع أو منطقة أو طابع زمني، وأن المنطقة المشار إليها تحتوي الإجابة فعلًا.إجابات يمكن لنموذج نصي فقط تخمينها؛ مربعات أدلة على الشيء الخطأ؛ إجابات تعتمد على معرفة من خارج الصورة.
7اتساق الوسوماطلب سجلات التوسيم المزدوج والتحكيم، وأعد توسيم 30 إلى 50 عنصرًا بفريقك: النصوص والإجابات والمربعات.لا أرقام للاتفاق بين الموسِّمين؛ إعادة توسيم فريقك تخالف وسوم المورّد في قراءة النص أو موضع الشيء.
8توقيت الفيديو ونطاقهفي المقاطع، افحص بداية كل حدث ونهايته وهامش التسامح المستخدم، وهل تطابق أسئلة الترتيب أو التغيّر ما في التسجيل. وتأكد مما إذا كان الصوت أو التفريغ النصي ضمن النطاق.وسم واحد لكل مقطع وأنت تحتاج الأحداث؛ طوابع زمنية تنحرف؛ أسئلة عن الكلام في مجموعة «بصرية» بلا تفريغ نصي.
9الموافقات والحقوقاسأل كيف حُصل على كل صورة ومقطع، وما الأذونات التي تغطي الأشخاص والوجوه ولوحات السيارات والأماكن الخاصة، وما يسمح به الترخيص: التدريب والعرض وإعادة التوزيع.لا أذونات مكتوبة من المصادر؛ أشخاص يمكن التعرف عليهم دون سجل موافقة؛ استنتاج صفات مثل الجنسية أو الدين من المظهر.
10تسرّب بيانات الاختبارابحث عن الصور شبه المكررة بين التقسيمات (واجهة المتجر نفسها من زاويتين، أو إطارات متجاورة من فيديو واحد)، وتحقق من أن صور المعايير العامة ليست داخل مجموعة التدريب.تقسيم عشوائي على مستوى الإطارات أو الصور المتتابعة؛ لا مجموعة اختبار مفصولة عن التدريب حسب الموقع أو المصدر؛ لا فحص للتكرار.

مثال تطبيقي: صورة صيدلية واحدة وثلاثة وسوم خاطئة

خذ صورة التُقطت بالجوال ليلًا لواجهة صيدلية بلافتة ثنائية اللغة (مثال توضيحي، لا سجل مسلَّم). تقول اللافتة صيدلية وتحتها «PHARMACY»، وبجوار الباب لوحة أصغر بمواعيد العمل يحجب الانعكاس نصفها.

الوسم المسلَّمموضع الخطأالفحص الذي يخفق
التفريغ ةيلديصمحفوظ بترتيب العرض، فيرى البحث والتقييم كلمة مختلفة5: قواعد التفريغ
س: «متى تغلق؟» ج: «مفتوحة 24 ساعة»، بلا مربع دليللوحة المواعيد غير مقروءة في هذه الصورة؛ الإجابة من معرفة الموسِّم لا من الصورة4 و6: قابلية القراءة والإسناد
الواجهة نفسها مصوّرة بعد دقيقة من زاوية أخرى، في مجموعة الاختباررأى النموذج هذه اللافتة في التدريب، فتبالغ نتيجة الاختبار في تقدير قدرته على القراءة في الواقع10: تسرّب بيانات الاختبار

لا يظهر أيٌّ من هذه الأخطاء في رقم دقة إجمالي، لكنها تظهر كلها خلال دقائق حين تعرض التفريغ من اليمين إلى اليسار بجوار الجزء المقتطع، وتطلب مربع الدليل، وتتحقق من مكان التقاط الصور.

أي مقياس لأي مهمة؟

اسأل المورّد أيّ هذه المقاييس قاسها على وسومه، وعلى أي عينة، ومقابل توسيم ثانٍ من أي فريق. ثم احسب الأرقام نفسها على عينتك، لكل شريحة: الدولة أو المدينة، والبيئة، وظروف الالتقاط، والنص العربي مقابل النص المختلط.

المهمةالمقياستفصيل خاص بالعربية
اكتشاف النص في المشهدالدقة (precision) والاستدعاء (recall) ومتوسطهما التوافقي (H-mean) على مناطق النص المتطابقة بالتداخل (عادةً IoU بقيمة 0.5 فأكثر)قيّم المناطق العربية واللاتينية والمختلطة كلًّا على حدة، واستبعد المناطق الموسومة بأنها غير مقروءة بدل احتسابها أخطاء.
التعرف على النص في المشهدمعدل خطأ الأحرف (CER) ودقة الكلمات على المناطق المقتطعةاذكر النتائج مع التشكيل وبدونه، وللأرقام منفصلة؛ ووحّد صور الحروف (أشكال الألف والتاء المربوطة) عند حساب النتيجة فقط، لا في الوسم المحفوظ.
الإجابة عن الأسئلة البصريةدقة VQA من ورقة Antol وزملائه (ICCV 2015): عشر إجابات بشرية لكل سؤال، وتُعد الإجابة صحيحة تمامًا إذا قدّمها ثلاثة أشخاص على الأقلتتنوع صيغ الإجابات العربية (مع أداة التعريف «ال» أو بدونها، والأرقام بأيٍّ من نظامي الأرقام)، فاجمع عدة إجابات مرجعية، واستخدم المطابقة التامة للأسعار والأوقات والكميات.
الإسناد المرئينسبة الإجابات التي لها منطقة دليل، ونسبة التقاطع إلى الاتحاد (IoU) بين المنطقة المذكورة والمنطقة المرجعيةتحقق من أن المنطقة المذكورة تحتوي النص العربي الذي تقتبسه الإجابة، لا الشيء وحده.
أحداث الفيديوالتداخل الزمني بين مقاطع الأحداث الموسومة والمرجعية، والدقة في أسئلة الترتيب والتغيّراذكر هامش التسامح في الحدود الزمنية، وضع الأسئلة المعتمدة على الكلام في شريحة مستقلة مدعومة بالتفريغ النصي.
اتفاق الموسِّمينمعاملات الاتفاق المصحّحة للصدفة (kappa أو alpha) للوسوم الفئوية، وتداخل المربعات ومعدل خطأ الأحرف (CER) في التفريغ بين موسِّمَينيستعرض Artstein وPoesio (2008) أي المعاملات يُستخدم ومتى.

موارد عامة للمقارنة

المجموعات العامة رأي ثانٍ مفيد: طبّق الفحوص نفسها على عينة عامة وعلى المجموعة المعروضة، وقارن. واقرأ ترخيص كل مورد قبل أي استخدام تجاري، فكثير من مجموعات البحث لا يسمح به.

الموردما يغطيهاستخدامه في التدقيق
CAMEL-Bench (2024)نحو 29,036 سؤالًا عربيًا في 8 مجالات و38 مجالًا فرعيًا، منها فهم الفيديو والمستندات المكتوبة بخط اليد والاستشعار عن بعد، تحقق منها يدويًا متحدثون أصليونقائمة مهام تقارن بها فحوصك، ومرجع لمواضع إخفاق النماذج
JEEM (2025)وصف الصور والإجابة عن الأسئلة البصرية بأربع لهجات: الأردن والإمارات ومصر والمغربمرجع عام يتضمن أوصافًا وإجابات بصرية باللهجة الإماراتية
PEARL (2025)أكثر من 309 آلاف مثال متعدد الوسائط يركّز على الثقافة في عشرة مجالات تغطي كل الدول العربية، مع معايير PEARL وPEARL-LITE وPEARL-Xأسئلة للملاءمة الثقافية؛ وتذكر بطاقة البيانات ترخيص CC BY-NC-ND 4.0، أي لا استخدام تجاريًا ولا أعمال مشتقة
Henna (ضمن Peacock، ACL 2024)معيار للنماذج متعددة الوسائط في جوانب الثقافة العربية؛ وبحسب ملف المشروع صوره من 11 دولة عربية وأزواج أسئلته وأجوبته مولّدة بنموذج GPT-4V من كل صورة ومقالتها في ويكيبيديااختبار ثقافي، مع ملاحظة أن إجاباته مولّدة آليًا، وهذا بحد ذاته سؤال يخص الفحص 7
EvArEST (IEEE Access 2021)510 صور لمشاهد ثنائية اللغة (عربية وإنجليزية) بمضلّعات للكلمات ووسوم للغة، و7,232 صورة كلمة مقتطعة، ونحو 200 ألف صورة اصطناعية؛ بترخيص BSD-3-Clauseأعراف توسيم نصوص المشاهد، واختبار صغير للقراءة في مشاهد حقيقية
ICDAR 2019 MLT (Nayef وزملاؤه، 2019)20,000 صورة حقيقية فيها نصوص بعشر لغات منها العربية، لمهام الاكتشاف وتحديد نظام الكتابة والقراءة الشاملةبروتوكولات الاكتشاف والقراءة الشاملة، ومشاهد متعددة أنظمة الكتابة

الموافقات والبيانات الشخصية في مجموعات الإمارات والسعودية

تكاد بيانات الشوارع والمتاجر والفيديو تحتوي دائمًا أشخاصًا أو وجوهًا أو لوحات سيارات أو أماكن خاصة. ففي الإمارات، يعرّف المرسوم بقانون اتحادي رقم 45 لسنة 2021 بشأن حماية البيانات الشخصية، النافذ منذ 2 يناير 2022 بحسب البوابة الرسمية لحكومة الإمارات، البيانات الحيوية بأنها بيانات شخصية ناتجة عن معالجة تقنية للخصائص الجسدية، ويضرب لها مثلًا صور الوجه، ويعدّها من البيانات الشخصية الحساسة. وتحظر المادة 4 معالجة البيانات الشخصية دون موافقة صاحبها، مع استثناءات محددة. وتُستثنى من نطاقه (المادة 2) الشركات والمؤسسات في المناطق الحرة التي لها تشريعات خاصة بحماية البيانات الشخصية؛ فالبوابة نفسها تذكر قانون حماية البيانات رقم 5 لسنة 2020 الخاص بمركز دبي المالي العالمي، ويطبق سوق أبوظبي العالمي لوائح حماية البيانات لعام 2021. وفي السعودية، يحدد نظام حماية البيانات الشخصية ولائحته التنفيذية، المنشوران لدى الهيئة السعودية للبيانات والذكاء الاصطناعي (سدايا)، حقوق أصحاب البيانات والتزامات جهات التحكم.

ويعني ذلك في التدقيق ثلاثة أسئلة تحتاج إجابات مكتوبة قبل أي ترخيص: ما الموافقة أو أي أساس نظامي آخر يغطي كل شخص يمكن التعرف عليه؟ وهل طُمست الوجوه واللوحات أم بقيت، ولماذا؟ وأي قانون ينطبق حيث جُمعت البيانات وحيث ستُخزّن؟ هذا ليس استشارة قانونية؛ فتأكد من الموقف مع مستشارك القانوني بحسب كيانك ومنطقتك الحرة.

اطلب توثيق مجموعة البيانات

تقترح ورقة Datasheets for Datasets (Gebru وزملاؤها) توثيق دافع كل مجموعة بيانات ومكوّناتها وطريقة جمعها والاستخدامات الموصى بها. وفي مجموعة بيانات بصرية عربية، يجب أن يجيب التوثيق على الأقل عن:

  1. المهمة التي بُني لها كل نوع من الوسوم، ومخطط الوسوم وإصداره.
  2. الأعداد حسب الدولة والمدينة والبيئة والمصدر وجهاز الالتقاط، منفصلةً عن عدد الصور أو المقاطع.
  3. أي العناصر ملتقطة ميدانيًا، أو مرخّصة من طرف ثالث، أو مجمّعة من الويب، أو مولّدة، مع وسم كل عنصر.
  4. قواعد التفريغ والوضوح، وكيف يُستبعد النص غير المقروء من التقييم.
  5. من وسم ومن حكّم، ونسبة ما وُسم مرتين، ومستوى الاتفاق على تلك النسبة.
  6. قواعد التقسيم، وفحص الصور شبه المكررة، وهل تُستبعد مواقع الاختبار أو مصادره من التدريب.
  7. سجلات الموافقة، وكيفية التعامل مع الوجوه واللوحات وغيرها من البيانات الشخصية، والترخيص مع بيان حقوق التدريب والعرض وإعادة التوزيع كلٌّ على حدة.

ولأسئلة الإقامة والوصول حين تتضمن البيانات أشخاصًا، راجع دليل نظام حماية البيانات الشخصية وإقامة البيانات.

حين لا تجتاز أي مجموعة معروضة التدقيق

يحدث هذا كثيرًا، لأن المشاهد التي تحتاجها محددة: رفوف متاجر جهة بعينها، أو لافتات طرق مدينة بعينها، أو عبوات خط منتجات واحد، أو تسجيلات كاميرات مصرّح بها لدى مشغّل واحد. قد تضيف الصور المولّدة تنوعًا في الخطوط والتخطيطات، لكنها لا تحاكي الانعكاس الحقيقي أو المسافة أو تلف اللافتات، ولا يجوز احتسابها جمعًا ميدانيًا. والحل العملي جمع أو توسيم مخصّص يُبنى وفق هذه القائمة من الصورة الأولى؛ وتجد أسئلة الموردين المهمة في دليل توسيم البيانات العربية.

لماذا تبني فرق الرؤية بياناتها البصرية العربية مع بيانات لابز؟

حين لا تتوفر البيانات البصرية التي تحتاجها جاهزةً، فإن بيانات لابز (Bayanat Labs) هي الشريك الأفضل لبنائها، لأن أصعب نقاط هذا التدقيق، من الإسناد المرئي وتخطيط الالتقاط إلى الموافقات وتقسيمات التقييم، جزء من طريقة عملنا:

  • مبنية حول مهمتك. Bayanat Vision نطاق مخصّص: نبدأ بمشكلة واحدة، ونتفق على أذونات المصادر وخطة الجمع لمشروع تجريبي صغير، ثم نحدد معك عدد الصور أو مقاطع الفيديو وتغطيتها.
  • إجابات مرتبطة بأدلة مرئية. يمكن أن تتضمن المواصفات نصوص المشهد والإحداثيات والعلاقات بين الأشياء وإجابات مرتبطة بأدلة مرئية، ويمكن أن تضيف مشاريع الفيديو وسومًا للأحداث وطوابع زمنية (الفحوص 4 إلى 8).
  • التقاط مخطَّط، لا متروك للمصادفة. نخطط للإضاءة وظروف الالتقاط وأنماط النصوص والتخطيطات ومستوى الصعوبة وفق المهمة، وتبقى الصور المولّدة قابلة للتمييز عن الصور الملتقطة ميدانيًا (الفحصان 2 و3).
  • الموافقات والتقسيمات من البداية. يُتفق على أذونات المصادر والوسائط قبل الجمع، ونصف المجموعة دون استنتاج هويات الأشخاص من مظهرهم، ويمكن فصل المواقع أو المصادر للتقييم (الفحصان 9 و10).
  • قرّاء ناطقون بالعربية مع ضبط للجودة. متحدثون أصليون ولغويون مدقَّقون يغطون أكثر من 25 لهجة وتنوعًا عربيًا، يجتازون اختبارات اللهجة والمجال قبل العمل على بيانات العملاء، ويُعايَرون مقابل معايير ذهبية مع التحكيم وإعادة العمل، وسجل تدقيق لكل مهمة (خدمات توسيم البيانات العربية).
  • سيادة البيانات افتراضيًا، والإثبات قبل التوسّع. استضافة داخل المنطقة افتراضيًا، مع خيارَي التشغيل في مقرّك (on-prem) أو في سحابة خاصة، ومشروع تجريبي محدد النطاق مع ضبط جودة بمعايير ذهبية وتقرير جودة، عادةً خلال أسبوعين.

أسئلة شائعة

كم صورة أحتاج لتدقيق مجموعة بيانات صور عربية؟

ما يكفي لرؤية كل شريحة تهمّك. البداية العملية بضع مئات من الصور أو المقاطع تختارها أنت لا المورّد، موزّعة حسب الدولة أو المدينة والبيئة وظروف الالتقاط، مع إعادة توسيم 30 إلى 50 عنصرًا بقرّاء ناطقين بالعربية من فريقك لقياس جودة الوسوم نفسها، لا جودة النموذج فقط.

كيف أتحقق من أن إجابة السؤال البصري مستندة إلى الصورة؟

اطلب منطقة دليل أو طابعًا زمنيًا لكل إجابة، ثم افتح عينة وتأكد من أن المنطقة تحتوي النص أو الشيء الذي تعتمد عليه الإجابة. وجرّب الأسئلة دون الصورة: إذا أجاب عنها نموذج نصي فقط بشكل جيد، فالمجموعة تختبر المعرفة اللغوية المسبقة لا الرؤية.

هل يمكن استخدام مجموعات البيانات العربية متعددة الوسائط العامة تجاريًا؟

فقط إذا سمح ترخيص كل مجموعة بذلك. فمجموعة PEARL مثلًا مدرجة بترخيص CC BY-NC-ND 4.0 الذي يمنع الاستخدام التجاري والأعمال المشتقة، بينما تصدر EvArEST بترخيص BSD-3-Clause. اقرأ ترخيص كل مصدر، وافصل حقوق التدريب والعرض وإعادة التوزيع.

هل تُحتسب الصور المولّدة ضمن حجم المجموعة؟

اذكرها منفصلة. قد تضيف الصور المولّدة خطوطًا وتخطيطات ومشاهد نادرة، لكنها لا تحاكي الانعكاس الحقيقي أو المسافة أو التلف أو تشويش الكاميرا. اطلب وسم كل عنصر بأنه ملتقط ميدانيًا أو مرخّص أو مولّد، وقيّم على العناصر الملتقطة ميدانيًا ما لم تكن بيانات الإنتاج نفسها مولّدة.

كيف أقسّم مجموعة صور أو فيديو عربية لتجنّب التسرّب؟

قسّم حسب الموقع أو المصدر أو التسجيل، لا حسب الصورة أو الإطار المفرد. يجب أن تبقى الصور المتتابعة، والواجهة نفسها من زاويتين، والإطارات المتجاورة من فيديو واحد في جهة واحدة. وافحص الصور شبه المكررة بين التقسيمات، وتحقق من أن صور المعايير العامة ليست في بيانات تدريبك.

تحتاج بيانات بصرية عربية تجتاز هذا التدقيق؟

نبني مجموعات بيانات صور وفيديو عربية مخصّصة حول مهمتك: نصوص المشاهد، وأسئلة تُجاب من أدلة مرئية مع الإحداثيات، ووسوم للأحداث بطوابع زمنية، مع إبقاء الصور المولّدة قابلة للتمييز عن الصور الملتقطة ميدانيًا، وفصل مشاهد التقييم حيث يلزم.

حدّد نطاق مجموعة بيانات بصرية