دليل · توسيم البيانات

دليل توسيم البيانات العربية للذكاء الاصطناعي: الأنواع والمراحل والجودة (2026)

كلمة واحدة تحمل جملة كاملة، وهمزة تُكتب بأكثر من صورة، ولهجات تقول المعنى نفسه بألفاظ مختلفة. دليل عملي للفرق التقنية يبدأ باختيار اللهجة وينتهي بقياس الاتفاق، ومعه نتائج LabelBench عن حدود التوسيم الآلي.

فريق أبحاث Bayanat Labs· · 15 دقيقة قراءة · Read in English

توسيم البيانات (Data Labeling) هو إضافة وسوم إلى بيانات خام ليتعلم منها نموذج الذكاء الاصطناعي: فئةٌ لرسالة، أو حدودُ كيانٍ في جملة، أو نصٌّ مفرَّغ لتسجيل صوتي، أو حكمٌ على إجابة نموذج لغوي. وفي العربية يسبق كلَّ وسمٍ قراراتٌ لا تواجهها فرق الإنجليزية: أيّ لهجة، وأيّ إملاء، وأين تنتهي الكلمة. هذا دليل توسيم البيانات العربية للفرق التقنية: أنواع المهام، ومراحل المشروع، وضبط الجودة، وما يستطيع الذكاء الاصطناعي توسيمه وحده.

توسيم أم وسم أم تصنيف؟ العمل نفسه يُسمّى أيضًا «وسم البيانات» و«تصنيف البيانات» و«التعليق التوضيحي للبيانات» (Data Annotation). نستخدم «التوسيم» لأنه الأشيع في السوق السعودية. وانتبه إلى أن «تصنيف البيانات» في الجهات الحكومية يعني تحديد مستوى سريتها، لا وسمها للتدريب. التفصيل في دليل مصطلحات توسيم البيانات بالعربية.

ما هو توسيم البيانات؟

النماذج التي تتعلم بالإشراف (Supervised Learning) تحتاج أمثلةً ومعها الإجابة الصحيحة، والتوسيم هو صناعة هذه الإجابات. رسالة عميل تقول «أبغى ألغي الاشتراك» تصبح مثالًا تدريبيًا حين يضيف إليها موسِّمٌ وسم النية cancel_subscription. وتسجيل مكالمة يصبح بيانات تدريب لنظام التعرف على الكلام (ASR) حين يُفرَّغ نصه وتُحدَّد أزمنته ومتحدثوه.

ويفرّق بعض المختصين بين الوسم، أي إسناد فئة إلى العنصر كله، والتعليق التوضيحي، أي تحديد بنية داخله كحدود الكيانات والطوابع الزمنية. وتُستخدم البيانات الموسومة في التدريب (ومنه الضبط الدقيق للنماذج اللغوية الكبيرة)، وفي التقييم، وفي المراقبة بعد الإطلاق. والخطأ المنهجي في الوسوم يتعلمه النموذج، ثم يخفيه الاختبار إن كان موسومًا بالطريقة الخاطئة نفسها.

لماذا توسيم البيانات العربية أصعب من الإنجليزية؟

يلخص فريق CAMeL Tools في جامعة نيويورك أبوظبي صعوبات معالجة العربية في أربع: غموض الكتابة، وغنى الصرف، وتنوع اللهجات، وعدم اتساق الإملاء. وكل واحدة منها تصبح في مشروع التوسيم قرارًا يجب أن يكتبه الدليل قبل أن يبدأ أول موسِّم.

1. الكلمة الواحدة قد تكون جملة

تلتصق بالكلمة العربية حروف العطف والجر وأداة التعريف والضمائر، وتُسمّى اللواصق (Clitics). «وسيكتبونها» كلمة واحدة في النص، وهي في المعنى «و + سـ + يكتبون + ها»، أي «وسوف يكتبونها». واللهجات تزيد التركيب: «مبيقولهاش» المصرية تعني «لا يقولها»، وتجمع في كلمة واحدة أداة النفي وسابقة المضارع والفعل والمفعول به ولاحقة النفي.

السؤال العملي في وسم الكيانات المسمّاة (NER): في «وبالرياض»، هل الكيان «الرياض» وحدها أم الكلمة كاملة؟ الخياران مقبولان، لكن خلط الموسِّمين بينهما يغيّر مواضع البداية والنهاية (Offsets) ويُفسد قياس الاتفاق.

2. الإملاء نفسه متغير

تُكتب الكلمة الواحدة بأكثر من صورة: «إسلام» و«اسلام»، و«مسؤول» و«مسئول»، و«مدرسة» و«مدرسه». لذلك توفر أدوات مثل CAMeL Tools دوالّ للتوحيد الإملائي (Normalization): تردّ صور الألف المهموزة إلى ألف مجردة، والتاء المربوطة إلى هاء، والألف المقصورة إلى ياء. لكن للتوحيد ثمنًا. حين تصبح «على» (حرف الجر) «علي»، تتطابق مع اسم العلم «علي»، فيلتبس على نموذج الكيانات ما كان واضحًا في النص الأصلي.

واللهجات بلا إملاء معياري أصلًا. تنقل ورقة CAMeL Tools عن Habash وزملائه (2018) رصد 27 طريقة لكتابة «مبيقولهاش» وحدها، منها «مبيقلهاش» و«مبؤلهاش». والقرار الأسلم في الغالب: احفظ النص كما ورد، وخزّن بجانبه نسخة موحَّدة للمطابقة وقياس الاتفاق، واكتب في الدليل على أي النسختين تُحسب المواضع. خطوات ذلك بالتفصيل في دليلنا العملي عن كيفية توسيم النصوص العربية (بالإنجليزية).

3. غياب التشكيل

تُكتب العربية عادةً بلا حركات، ويعدّ فريق CAMeL Tools ذلك المصدر الرئيسي للغموض في معالجتها آليًا. «علم» قد تكون «عِلْم» أو «عَلَم» أو «عَلِمَ» أو «عُلِّمَ». القارئ يحسمها من السياق، والدليل يحدد: هل يُوسم المعنى المرجَّح أم يُعلَّم العنصر ملتبسًا؟

4. اللهجات تقول المعنى نفسه بألفاظ أخرى

«أبغى أروح السوق الحين» بالخليجية هي «عايز أروح السوق دلوقتي» بالمصرية، و«بدّي روح عالسوق هلّق» بالشامية. جملة واحدة بثلاث صيغ لا تكاد تشترك إلا في «السوق». وفي الصوت يتسع الاختلاف: القاف تُنطق في كثير من لهجات الخليج قريبًا من /g/، وتُنطق همزةً في مدن مصر والشام. ولهذا التنوع بُنيت موارد مثل مدوّنة MADAR التي جمعت جملًا متوازية بلهجات 25 مدينة عربية.

ولا تنتقل الأدوات المبنية للفصحى إلى اللهجات. تنقل ورقة CAMeL Tools أن أداة متقدمة للتحليل الصرفي مبنية للفصحى (Pasha وزملاؤه، 2014) بلغت دقتها في وسم أقسام الكلام نحو 72% على نص خليجي، مقابل 96% على الفصحى. فالوسوم المسبقة (Pre-labels) التي تنتجها أداة فصحى على نص لهجي تنقل أخطاءها إلى الموسِّم. ويضاف إلى ذلك خلط العربية بالإنجليزية («أرسل لي الـlocation») والعربيزي (Arabizi) مثل «7abibi»، وكلاهما يحتاج قاعدة مكتوبة في الدليل.

أنواع توسيم البيانات: نص وصوت وصورة وفيديو ومخرجات النماذج

لكل نمط مهامه، ولكل مهمة قرار عربي يحسمه الدليل:

النمطمهام شائعةمثال عربيالقرار الذي يحسمه الدليل
النص: التصنيفالنوايا، والمشاعر، والإشراف على المحتوى، وتحديد اللهجة«ما شاء الله عليكم، ثلاث ساعات والطلب ما وصل»ألفاظ ثناء ورسالة شكوى: يُوسم المقصود لا الظاهر.
النص: المقاطع والكياناتالكيانات المسمّاة، والعلاقات، واستخراج الحقول«حوّلت 500 ريال لحساب أبو فهد»هل الكنية «أبو فهد» كيان شخص؟ وهل «500 ريال» مبلغ واحد أم رقم وعملة؟
الصوتالتفريغ الصوتي (Transcription)، والطوابع الزمنية، وفصل المتحدثين (Diarization)، ووسم اللهجة واللكنةمتصل من الرياض ينطق «قلت له» بقاف تُسمع /g/تُكتب «قلت» بالإملاء المعتاد أم يُثبَت النطق؟ الاتساق أهم من الخيار نفسه.
الصور والمستنداتالتعرّف الضوئي على الحروف (OCR)، والمربعات المحيطة (Bounding Boxes)، واستخراج حقول المستنداتعقد إيجار ممسوح ضوئيًا فيه جوال بالأرقام الهندية «٠٥٥…»تُفرَّغ الأرقام كما كُتبت أم تُحوَّل إلى 055؟ وما ترتيب القراءة في سطر يخلط العربية بالأرقام والإنجليزية؟
الفيديووسم الأفعال والأحداث، وتتبع العناصر، والنص الظاهر على الشاشةإعلان بعنوان عربي متحرك وتعليق صوتي بلهجة محليةعند أي إطار يبدأ الحدث وينتهي؟ وهل يُفرَّغ النص الظاهر مع الكلام؟
مخرجات النماذجترتيب التفضيل (Preference Ranking)، وإعادة الكتابة للضبط الدقيق (SFT)، والتقييم بمعايير، واختبارات الاختراق (Red Teaming)إجابتان من نموذج لغوي عن سؤال في نظام العمل السعوديمن يحق له الحكم: مختص مرخّص أم موسِّم عام؟ وبأي معيار: الصحة أم السلامة أم الأسلوب؟

ولبيانات التفضيل ومواءمة النماذج تفاصيل تخصها نشرحها في صفحة RLHF للنماذج العربية.

كيف تختار اللهجات والمستوى اللغوي قبل البدء؟

أغلى أخطاء المشاريع العربية يقع قبل التوسيم: أن تُعامَل البيانات على أنها «عربية» فحسب. ثلاث دراسات منشورة تبيّن السبب:

  • البيانات ليست كما تظن. في دراسة Bergman وDiab (2022) على محتوى منصات التواصل الاجتماعي، صنّف خبراء ثقافيون 74% من العينات العربية في مجموعة البيانات السعودية محتوى غير سعودي. ونبّه الباحثان إلى أن كثيرًا من اختبارات الكفاءة الجاهزة في العربية خاصة بالفصحى.
  • كلما ابتعد النص عن الفصحى قلّ اتفاق الموسِّمين. وجد Keleg وMagdy وGoldwater (ACL 2024) في 11 من 15 مجموعة بيانات أن العينات الأعلى لهجيةً أصعب في الوسم، خاصة حين لا يتكلم الموسِّم لهجتها. وأوصوا بإسنادها إلى متحدثيها الأصليين.
  • النص القصير قد ينتمي إلى أكثر من لهجة. حين راجع متحدثون أصليون «أخطاء» نظام لتحديد اللهجة، وجد Keleg وMagdy (2023) أن نحو 66% منها ليست أخطاء فعلًا. فـ«شلونك؟» مثلًا تُقال في العراق والكويت معًا.

ومن هنا خمسة قرارات تُتخذ قبل كتابة الدليل:

  1. قِس مزيج اللهجات في عينة من بياناتك الفعلية، لا في توقعات الفريق.
  2. سمِّ اللهجة لا الإقليم. المشروع السعودي يحدد النجدية أو الحجازية أو الجنوبية، لا «الخليجية» عمومًا. فحتى داخل المملكة تختلف المفردات والنطق من منطقة إلى أخرى.
  3. أضف وسمًا للمستوى اللغوي في كل عنصر: فصحى، أو لهجة، أو مزيج، أو عربيزي.
  4. اسمح بأكثر من لهجة للعنصر الواحد حين يصلح النص لأكثر من لهجة.
  5. وجّه كل لهجة إلى متحدثيها، واختبر الموسِّمين في اللهجة نفسها لا في الفصحى وحدها.

تصميم التصنيفات: لماذا لا يكفي «نعم/لا»؟

التصنيف (Taxonomy) هو قائمة الوسوم وقواعد اختيارها. أسهل التصنيفات هو الثنائي: مسيء أو غير مسيء، إيجابي أو سلبي. لكنه نادرًا ما يكفي لقرار حقيقي. فريق الإشراف على المحتوى يحتاج نوع الإساءة ليقرر الحذف أو التحذير، وفريق خدمة العملاء يحتاج سبب الشكوى لا وجودها فقط.

مثال من الأدبيات: قسّمت مهمة OSACT5 المشتركة (2022) المحتوى العربي على ثلاث طبقات. هل النص مسيء؟ وإن كان، فهل هو خطاب كراهية؟ وإن كان، فعلى أي أساس: العرق أو الدين أو الأيديولوجيا أو الإعاقة أو الطبقة الاجتماعية أو النوع الاجتماعي؟

والفرق بين المستويين ليس شكليًا. في LabelBench، وعلى مجموعة التقييم المحجوزة الثابتة (Held-out) نفسها، حقق Qwen 2.5 3B دقة 78.0% في تصنيف السمية الثنائي. ثم هبطت مطابقته التامة إلى 25.3% مع التصنيف الأصلي ذي الوسوم السبعة. فالنموذج الذي يبدو جاهزًا للسؤال الثنائي قد لا يكون جاهزًا للسؤال الذي يحتاجه عملك. وعند تصميم التصنيف:

  • ابدأ من القرار الذي سيُتخذ بالوسم، لا من قائمة منقولة من مشروع آخر.
  • وسم واحد أم عدة وسوم (Multi-label)؟ الرسالة قد تكون شكوى وطلب استرداد معًا.
  • اجعل التصنيف هرميًا حين يكون المجال هرميًا: مسيء، ثم كراهية، ثم نوعها.
  • أضف خيار «ملتبس» وافصله عن «أخرى»: الأول يكشف ثغرة في الدليل، والثاني ثغرة في التصنيف.
  • أرفق بكل وسم أمثلة عربية تنطبق عليه، ومثالًا قريبًا لا ينطبق، من كل لهجة مشمولة.

مراحل توسيم البيانات: دليل التوسيم والمجموعة الذهبية والاتفاق بين الموسِّمين

يمر مشروع التوسيم المنضبط بسبع مراحل، وكل مرحلة تُختصر تعود كلفتها إعادةَ عمل:

  1. تحديد الهدف والمخرجات: المهمة، والنموذج المستهدف، وصيغة التسليم، ومستوى حساسية البيانات.
  2. عينة استكشافية: قياس مزيج اللهجات والحالات الصعبة الفعلية.
  3. دليل التوسيم (Annotation Guidelines): تعريف كل وسم مع أمثلته، وقواعد اللواصق والتوحيد الإملائي والخلط اللغوي.
  4. المجموعة الذهبية (Gold Set): عناصر من بياناتك يحكّمها لغويون متمرّسون. تُستخدم لتدريب الموسِّمين واختبارهم، ثم لفحصهم خفيةً أثناء الإنتاج.
  5. المشروع التجريبي (Pilot): توسيم مستقل لشريحة محددة، وقياس الاتفاق، وتعديل الدليل حيث يكون الخلاف منهجيًا.
  6. الإنتاج: عناصر ذهبية مخفية، وعينة متداخلة يوسمها أكثر من موسِّم، وتحكيم (Adjudication) للخلافات، وإعادة عمل لما يرسب.
  7. التسليم: البيانات وفق المخطط، ومعها تقرير جودة لكل لهجة ولكل وسم، وسجل تدقيق يبيّن من وسم ماذا ومتى.

كيف تُقاس جودة توسيم البيانات؟

نسبة الاتفاق الخام بين موسِّمَين مضلِّلة. مثال توضيحي: إذا كانت 90% من الرسائل غير مسيئة، فموسِّمان يختاران «غير مسيء» دائمًا يتفقان بنسبة 90% دون أن يقيسا شيئًا. لذلك تُستخدم مقاييس تصحّح أثر الصدفة، كما يشرح Artstein وPoesio (2008). منها معامل كابا لكوهين (Cohen's kappa) لموسِّمَين، ومعامل ألفا لكريبندورف (Krippendorff's alpha) لأكثر من موسِّمَين أو حين تنقص بعض الوسوم. أما حدود الكيانات فتُقاس غالبًا بمقياس F1.

وثلاث قواعد تجعل الرقم مفيدًا. افصل التقرير حسب اللهجة والوسم، لأن المتوسط يخفي اللهجة المتعثرة. وعامِل الخلاف المتكرر على أنه عيب في الدليل لا في الموسِّم. وأعد قياس الاتفاق بعد كل تعديل على الدليل.

هل يستطيع الذكاء الاصطناعي توسيم البيانات العربية؟

جزئيًا، وبشرط أن يُقاس ذلك على بياناتك. هذا ما صُمم LabelBench، تدقيقنا القابل لإعادة الإنتاج، لاختباره. الأرقام التالية تخص النماذج المحلية المقيَّمة في الإصدار v0.1 على مجموعة التقييم المحجوزة الثابتة وحدها، ولا تعني أن كل النماذج اللغوية تفشل في العربية:

المهمة (LabelBench v0.1)Qwen 2.5 3BFanar 1 9B
السمية الثنائية (الدقة)78.0%88.0%
السمية بالتصنيف ذي الوسوم السبعة (مطابقة تامة)25.3%31.3%
تحديد اللهجة بين خمس مناطق (التخمين العشوائي 20%)22.4%47.8%
SAC95 (توجيه بثقة متساوية، بروتوكول v0.1)0%0%

ثلاث قراءات لهذه الأرقام. أولًا، الأداء على السؤال الثنائي لا يتنبأ بالأداء على التصنيف الحقيقي. ثانيًا، الأخطاء منهجية لا عشوائية: توقّع Qwen 2.5 3B «مصرية» لما بين 70% و80% من أمثلة كل منطقة غير مصرية، فبقيت دقته قرب حد التخمين. ثالثًا، التخصص في العربية يساعد: تفوّق Fanar 1 9B في المهام الثلاث، لكن وسومه لم تبلغ مستوى القبول دون مراجعة.

ومقياس Safe Automation Coverage (SAC) يسأل: ما أكبر نسبة من طابور التوسيم يمكن قبولها آليًا مع بقاء الحد الأدنى لفاصل الثقة لدقة ما يُقبَل فوق 95%؟ لم يحقق أي تشغيل توليدي في الإصدار v0.1 قيمة أعلى من الصفر، لأن النماذج أعادت وسومًا بلا احتمالات معايَرة، فتساوت درجات ثقتها ولم يمكن فصل الواثق منها عن غيره، ولم تبلغ دقة المجموعة كاملة حد 95%. وSAC أداة تشخيص، لا بديل عن اختبار المراجعة البشرية. والخلاصة العملية:

  • قابل للأتمتة: الوسوم البسيطة كثيرة الأمثلة، بعد أن يتجاوز النموذج حد الجودة على مجموعتك الذهبية.
  • وسوم مسبقة بمراجعة بشرية: المهام الموضوعية كاستخراج التواريخ والمبالغ، مع قياس دوري لما يغيّره المراجعون.
  • بشري بالكامل: التصنيفات متعددة الوسوم، واللهجة، والسخرية، والأحكام المتخصصة، ووسوم السلامة.

ما الذي يحدد تكلفة توسيم البيانات العربية؟

السعر يتبع الجهد، والجهد تحدده خمسة عوامل: عدد الوسوم وتعقيد التصنيف، وعدد اللهجات وندرة متحدثيها، والحاجة إلى مختص مرخّص كالطبيب أو المحامي، ونسبة المراجعة المزدوجة والتحكيم، ونمط البيانات. فساعة من مكالمات لهجية تتداخل فيها الأصوات تستغرق أضعاف ما تستغرقه تغريدة. التفصيل في مقالتنا عن محددات تكلفة توسيم البيانات العربية (بالإنجليزية).

في Bayanat Labs بالرياض نبني كل مشروع حول هذه القرارات. نغطي أكثر من 25 لهجة وتنويعة عربية بمتحدثين أصليين ولغويين ومختصين مرخّصين، يجتازون فرزًا في اللهجة والمجال قبل أن يروا بيانات العميل. ويُعايَر العمل على مجموعات ذهبية مع تحكيم وإعادة عمل، ولكل مهمة سجل تدقيق، وتُستضاف البيانات داخل المنطقة افتراضيًا. ونبدأ بمشروع تجريبي بنطاق ثابت، يُنجَز عادةً خلال أسبوعين. التفاصيل في خدمات توسيم البيانات العربية.

دليل توسيم البيانات في قائمة تحقق: تسعة أسئلة قبل الإنتاج

قبل أن يبدأ الإنتاج، ينبغي أن تكون الإجابة «نعم» عن كل سؤال:

  1. هل يرتبط كل وسم بقرار سيتخذه النموذج أو الفريق؟
  2. هل قسنا مزيج اللهجات والمستوى اللغوي في عينة فعلية، وسمّينا اللهجات المشمولة؟
  3. هل يحدد الدليل قاعدة اللواصق في حدود المقاطع؟
  4. هل قررنا ما يُوحَّد إملائيًا (الهمزات، والتاء المربوطة، والألف المقصورة) وما يُحفظ كما ورد، وعلى أي نسخة تُحسب المواضع، وما قاعدة العربيزي والكلمات الإنجليزية؟
  5. هل يسمح التصنيف بتعدد الوسوم وبخيار «ملتبس» حيث يلزم؟
  6. هل لدينا مجموعة ذهبية من بياناتنا حكّمها متحدثون أصليون؟
  7. هل نقيس الاتفاق بمقياس مصحَّح للصدفة، لكل لهجة ولكل وسم؟
  8. هل اختبرنا أي توسيم آلي على المجموعة الذهبية قبل قبول وسومه؟
  9. هل نعرف أين تُخزَّن البيانات، ومن يطّلع عليها، وأين يقيم الموسِّمون؟ راجع قائمة التحقق لنظام حماية البيانات الشخصية وإقامة البيانات (بالإنجليزية).
أهم النقاط
  • التوسيم قرارات قبل أن يكون عملًا. اللواصق والإملاء والتشكيل واللهجة تُحسم في الدليل، لا أثناء الإنتاج.
  • سمِّ اللهجة ووجّهها إلى أهلها. الاتفاق يتراجع كلما ابتعد النص عن الفصحى.
  • الثنائي لا يكفي. في LabelBench هبط أحد النماذج المقيَّمة من 78.0% في السمية الثنائية إلى 25.3% مع التصنيف ذي الوسوم السبعة.
  • قِس الجودة مصحَّحة للصدفة، لكل لهجة ولكل وسم.
  • الأتمتة تُثبَت ولا تُفترض. اختبر أي نموذج على مجموعتك الذهبية قبل قبول وسومه.

أسئلة شائعة

كم يستغرق مشروع توسيم البيانات العربية؟

يتوقف ذلك على حجم البيانات، وعدد اللهجات، وتعقيد التصنيف، ونسبة العناصر التي تُوسَم مرتين. والأفضل ألا يبدأ الإنتاج قبل مشروع تجريبي على شريحة من بياناتك، يثبّت الدليل ويقيس الإنتاجية الفعلية ومعدلات الخطأ، فيُبنى الجدول الزمني على أرقام مقيسة لا على تقديرات. في Bayanat Labs يُنجَز المشروع التجريبي عادةً خلال أسبوعين، ومعه تقرير جودة يبيّن ما يتطلبه التوسع.

هل يكفي أن يفهم الموسِّم اللهجة ليوسم نصوصها؟

غالبًا لا. كثير من العرب يفهمون لهجات غيرهم فهمًا سلبيًا، وهذا لا يكفي لالتقاط السخرية أو الإساءة المبطّنة أو الكنايات المحلية. وينبّه Bergman وDiab إلى أن المتحدث قد يعدّ نفسه متمكنًا من لهجة لا يتقنها، لذا تُختبر كفاءته في تلك اللهجة تحديدًا. والأسلم أن يوسم كل لهجة متحدثوها الأصليون، وأن يحكّم الخلافات لغوي من أهلها.

ما الصيغة المناسبة لتسليم البيانات العربية الموسومة؟

الشائع JSONL لعناصر التصنيف ومخرجات النماذج، وصيغ قائمة على الكلمات مثل CoNLL للكيانات. والأهم من الصيغة ثلاثة أمور: توحيد ترميز Unicode إلى صيغة NFC قبل حساب المواضع، لأن «أ» قد تُخزَّن رمزًا واحدًا أو ألفًا تليها همزة مركّبة (وتوفر CAMeL Tools دالة لذلك)؛ وحفظ النص الأصلي بجانب النسخة الموحَّدة؛ وتسجيل نسخة الدليل التي وُسم بها كل عنصر.

كم عنصرًا أحتاج إلى توسيمه لتدريب نموذج عربي؟

لا يوجد رقم عام، فالعدد يتبع المهمة وعدد الوسوم وتوازنها وعدد اللهجات ونقطة انطلاق النموذج. الطريقة العملية: وسّم مجموعة تقييم موثوقة أولًا، ثم درّب على دفعات متزايدة وراقب الأداء لكل لهجة ولكل وسم، وتوقف حين تكفّ الزيادة عن التحسين. والوسوم النادرة واللهجات القليلة في بياناتك تحتاج في الغالب جمعًا موجّهًا، لا مزيدًا من البيانات العشوائية.

أبحث عن عمل في توسيم البيانات العربية، من أين أبدأ؟

إن كنت تبحث عن عمل موسِّمًا أو مقيِّمًا، فابدأ بمقالتنا عن وظائف توسيم البيانات وتدريب الذكاء الاصطناعي عن بعد، ثم قدّم مجانًا عبر شبكة Bayanat للمواهب: عمل مرن عن بعد، مدفوع لكل مهمة، ويبدأ باجتياز فرز في اللهجة والمجال.

اختبر دليل التوسيم على بياناتك

مشروع تجريبي بنطاق ثابت على عينة من بياناتك: لهجات محددة بالاسم، ومجموعة ذهبية، وتقرير جودة لكل لهجة ولكل وسم، يُنجَز عادةً خلال أسبوعين، مع استضافة البيانات داخل المنطقة افتراضيًا.

اطلب مشروعًا تجريبيًا