قائمة فحص · المستندات والتعرّف الضوئي

كيف تقيّم مجموعة بيانات OCR عربية قبل شرائها: 10 فحوص

اطلب عينة من 50 إلى 100 صفحة، وافتح الملفات بنفسك، وقيّمها بندًا بندًا. يغطي هذا الدليل اتجاه الكتابة وترتيب القراءة وأنظمة الأرقام والجداول ودقة الحقول واتساق التوسيم وتقسيم البيانات والترخيص، مع موارد عامة للمقارنة.

فريق أبحاث Bayanat Labs· · 12 دقيقة قراءة · Read in English

لتقييم مجموعة بيانات للتعرّف الضوئي على الحروف (OCR) أو للاستخراج المنظّم من المستندات العربية قبل شرائها، اسحب بنفسك عينة من 50 إلى 100 صفحة، وأعد تفريغ (Transcription) جزء منها بقرّاء من الناطقين الأصليين بالعربية، ثم افحص عشرة بنود: الترميز، واتجاه الكتابة وترتيب القراءة (Reading Order)، والأرقام، وقواعد الحروف، والإحداثيات، والجداول، والحقول، واتساق التوسيم (Annotation)، والتنوّع والتقسيمات (Splits)، والمصدر والترخيص. قيّم كل بند منفصلًا ولا تكتفِ برقم دقة واحد، لأن أخطاء المستندات العربية تتركز في مواضع محددة: نقطة، أو مجموعة أرقام، أو زوج مفتاح وقيمة (Key-Value) معكوس، أو خلية جدول مدموجة.

هذه القائمة لفرق فهم المستندات (Document AI) التي تشتري أو ترخّص بيانات عربية للتعرّف الضوئي أو تحليل التخطيط أو استخراج الحقول، سواء أكانت مجموعة جاهزة، أم معيارًا عامًا تبني عليه، أم مجموعة مخصّصة سيسلّمها مورّد. وللتعرّف على أنواع التوسيم نفسها راجع دليل أنواع توسيم البيانات.

الخلاصة
  • اختر العينة بنفسك. الصفحات التي يختارها المورّد تُظهر أفضل الحالات. وزّع العينة حسب نوع المستند ونسبة الكتابة اليدوية وجودة الالتقاط.
  • افصل المستويات. النص (CER) وترتيب القراءة والحقول (التطابق التام Exact Match وF1) والجداول (TEDS) والإجابات (ANLS) يفشل كلٌّ منها على حدة، ولكلٍّ مقياسه.
  • احسب القوالب لا الصفحات. عشرة آلاف صفحة من 12 قالبًا (مثال توضيحي) مجموعة صغيرة إذا كان الهدف التعميم. اطلب معرّفات الجهات المُصدِرة (Issuers) والقوالب (Templates)، وتقسيمات تفصل بينها.
  • الترخيص جزء من الجودة. حقوق التدريب والعرض وإعادة التوزيع منفصلة، والمجموعات العامة كثيرًا ما تجمع تراخيص مختلفة.

لماذا تحتاج بيانات المستندات العربية فحصًا خاصًا؟

يذكر معيار KITAB-Bench (Heakl وآخرون، Findings of ACL 2025)، وهو معيار للتعرّف الضوئي وفهم المستندات العربية يضم 8,809 عينات في 9 مجالات و36 مجالًا فرعيًا، أن الخطوط المعقدة وأخطاء التعرّف على الأرقام ومدّ الكلمات (التطويل) واكتشاف بنية الجداول ما زالت من التحديات القائمة، وأن أفضل نموذج لم يتجاوز 65% من الدقة في تحويل ملفات PDF إلى Markdown. وما دامت النماذج تخطئ في هذه المواضع، فلا بد أن تكون البيانات المرجعية (Ground Truth) التي تُدرَّب عليها وتُختبر بها صحيحة فيها تحديدًا.

وثلاث حقائق خاصة بالعربية تقف وراء معظم الفحوص التالية:

  • ترتيب التخزين غير ترتيب العرض. يخزّن Unicode النص بالترتيب المنطقي (ترتيب القراءة)، وخوارزمية النص ثنائي الاتجاه تعيد ترتيبه عند العرض. لذلك قد يُنسخ سطر يجمع العربية والرموز اللاتينية والأرقام بترتيب خاطئ ويبدو مع ذلك سليمًا على الشاشة.
  • أكثر من نظام للأرقام. الأرقام 0–9 (الشائعة في الخليج باسم «العربية»)، والأرقام المشرقية ٠–٩ (U+0660–0669) المعروفة بـ«الهندية»، والمشرقية الممتدة ۰–۹ (U+06F0–06F9) المستخدمة في الفارسية والأردية، وهي نقاط ترميز مختلفة في الفصل 9 من معيار Unicode.
  • النقاط والحركات تغيّر المعنى. «خبر» و«حبر» تفرّق بينهما نقطة، و«درَس» و«درّس» تفرّق بينهما شدّة.

الفحوص العشرة لمجموعة بيانات OCR عربية

طبّق الفحوص كلها على العينة نفسها. الإخفاق في البنود 1 أو 2 أو 3 أو 9 أو 10 ينهي التقييم غالبًا، أما بقية البنود فيستطيع المورّد معالجتها عادة بتعديل المواصفات وإعادة التسليم.

#الفحصطريقة الفحصعلامة الخطر
1الترميزابحث في النصوص المفرّغة عن رموز أشكال العرض (U+FB50–FDFF وU+FE70–FEFF) ومحارف التحكم الشاردة واختلاف التطبيع.تخزين «ﻻ» رمزًا واحدًا بدل «ل» + «ا»، أو نص مأخوذ من طبقة نص PDF لا مفرّغ يدويًا.
2اتجاه الكتابة وترتيب القراءةاعرض كل سطر من اليمين إلى اليسار بجانب صورته، وراجع الأسطر المختلطة (عربية مع رموز الفواتير وأرقام الهاتف والمبالغ) وترتيب المناطق في الصفحات متعددة الأعمدة.عربية معكوسة («ةروتافلا»)، أو مجموعات أرقام بترتيب العرض، أو أعمدة تُقرأ من اليسار.
3الأرقامتأكد أن الأرقام محفوظة كما طُبعت، وأن القيمة الموحّدة في حقل منفصل، وراجع فواصل الآلاف والكسور.تحويل «٤» إلى 4 في البيانات المرجعية دون إشارة، أو حفظ «١٬٢٥٠٫٠٠» على أنها «١٢٥٠٠٠».
4قواعد الحروف والنقاط والحركاتاقرأ دليل التفريغ: هل هو حرفي (Diplomatic: كما كُتب) أم مصحَّح (كما قُصد)؟ هل تُحفظ الحركات كما طُبعت؟ كيف تُعلَّم المقاطع غير المقروءة؟لا قاعدة مكتوبة، أو خلط الأسلوبين في مجموعة واحدة، أو حذف الحركات من البيانات المرجعية.
5الإحداثياتاعرض المربعات والمضلعات مُركَّبةً على صور 20 صفحة. يجب أن يشمل مربع الكلمة النقاط والحركات فوق السطر وتحته.مربعات تقطع النقاط، أو مضلع يدمج سطرين، أو إحداثيات لصفحة بمقاس آخر.
6الجداولراجع مربعات الخلايا وأرقام الصفوف والأعمدة والخلايا المدموجة وتمييز خلايا الرأس في الجداول العربية.ترقيم الأعمدة من اليسار دون قاعدة معلنة، أو تكرار الخلايا المدموجة، أو تقييم البنية والنص برقم واحد.
7الحقول وربط المفتاح بالقيمةفي الاستمارات والفواتير: هل كل قيمة مربوطة بمفتاحها؟ هل تُحفظ القيمة المطبوعة والقيمة الموحّدة معًا؟ هل التواريخ الهجرية والميلادية معلّمة؟حقول استخرجها نموذج ولم يراجعها إنسان، أو إجماليات لا تطابق البنود.
8اتساق التوسيماطلب سجلات التفريغ المزدوج والتحكيم (Adjudication)، وأعد تفريغ 10 إلى 20 صفحة بفريقك وقارن.لا أرقام اتفاق، أو حسم الخلاف بالأغلبية دون مراجع خبير، أو خلاف بين تفريغك وتفريغ المورّد على الأرقام أو النقاط.
9التنوّع والتقسيماتاطلب عدد الجهات المُصدِرة والقوالب والكتّاب وأجهزة الالتقاط، وطريقة فصل مجموعة الاختبار.عدد صفحات فقط، أو صفحات اختبار تشترك في القوالب أو الكتّاب مع صفحات التدريب.
10المصدر والموافقة والترخيصاسأل من أين جاءت كل صفحة، وما البيانات الشخصية فيها، وماذا يتيح الترخيص: التدريب أو العرض أو إعادة التوزيع أو الأعمال المشتقة.لا أذونات مصدر مكتوبة، أو هويات وفواتير حقيقية دون تجهيل، أو مصدر بحثي فقط داخل مجموعة تجارية.

مثال تطبيقي: سطر واحد من فاتورة، وثلاثة أخطاء محتملة

خذ سطرًا من فاتورة ضريبية سعودية ثنائية اللغة. تشترط اللائحة التنفيذية لنظام ضريبة القيمة المضافة (المادة 53، الفقرة 5) أن تُدوَّن بيانات الفاتورة الضريبية بالعربية، وأن يكون أي نص بلغة أخرى ترجمةً لها، فتجتمع العربية واللاتينية والأرقام في السطر نفسه.

المطبوعما سلّمه المورّدالفحص الذي يفشل
رقم الفاتورة: INV-2024-0183المفتاح العربي معكوسًا، كما تُخرجه بعض طبقات نص PDF1 و2: نص مستخرج لا مفرّغ، وضياع الترتيب المنطقي
الإجمالي: ١٬٢٥٠٫٠٠ ر.س١٢٥٠٠٠3: سقطت الفواصل فصار المبلغ مختلفًا، ولم تُحفظ القيمة المطبوعة
إجمالي بجانبه تصحيح بخط اليدالإجمالي المطبوع وحده، دون ربط بالتصحيح7: غاب الحقل الذي يحتاجه نموذج التحقق

لا يظهر أيّ من هذه الأخطاء في رقم دقة على مستوى الصفحة، وتظهر الثلاثة سريعًا بمقارنة السطر المعروض من اليمين إلى اليسار بصورته.

أي مقياس لأي مستوى؟

اسأل المورّد أيّ هذه المقاييس قاسها على بياناته، وعلى أي عينة، ومقابل أي تفريغ ثانٍ. ثم احسبها بنفسك على عينتك.

المستوىالمقياستفصيل خاص بالعربية
نص السطر والكلمةمعدل خطأ الأحرف والكلمات (CER وWER)أبلغ عنه بالحركات ومن دونها، ومنفصلًا للأرقام والمقاطع اللاتينية. ولا تطبّع (Normalize) النص إلا عند التقييم.
ترتيب القراءةأخطاء الترتيب لكل صفحة، ومسافة تحرير ترتيب المناطققيّم الأسطر مختلطة الاتجاه وحدها، ففيها تكمن معظم أخطاء الاتجاه.
الحقولالتطابق التام على القيم الموحّدة، والدقة (Precision) والاستدعاء (Recall) وF1 لكل نوع حقل، ودقة ربط المفتاح بالقيمةالتواريخ بالتقويمين، والمبالغ بالفواصل العربية، وأرقام الهوية والإقامة.
الجداولTEDS، مقياس التشابه بمسافة تحرير الشجرة الذي قُدّم مع PubTabNet (Zhong وآخرون، 2019)صرّح بقاعدة ترتيب الأعمدة في الجداول العربية، وقيّم البنية منفصلة عن نص الخلايا.
أسئلة المستنداتANLS، من ورقة ST-VQA (Biten وآخرون، 2019)، ويُستخدم في DocVQAيمنح درجة جزئية لهفوات القراءة الصغيرة، فقد يكافئ رقمًا خاطئًا في مبلغ مع أنه خطأ كامل؛ لذا أضف التطابق التام للإجابات الرقمية.
اتفاق الموسّمينمعامل اتفاق مصحَّح للصدفة على عينة موسومة مرتينمثل kappa أو alpha للتسميات الفئوية؛ ويشرح Artstein وPoesio (2008) متى يُستخدم كلٌّ منهما.

وأبلغ عن كل مقياس حسب الشريحة: مطبوع أو يدوي، ونوع المستند، وجودة الالتقاط (ماسح ضوئي أو صورة جوال أو فاكس). المجموعة التي تحقق نتائج ممتازة على المسح النظيف ولا تضم صورة جوال واحدة لا تصلح لتطبيق يسجّل العملاء عبر الجوال.

موارد عامة للمقارنة

المجموعات العامة رأي ثانٍ مفيد: طبّق الفحوص نفسها على عينة منها وعلى المجموعة المعروضة وقارن. وراجع ترخيص كل منها قبل أي استخدام تجاري.

المجموعةما يغطيهفائدته في الفحص
KITAB-Bench (2025)8,809 عينات في 9 مجالات: الكتابة اليدوية والجداول والرسوم البيانية وتحويل PDF إلى Markdown وغيرهاقائمة مهام ومقاييس تحتذيها، ومرجع لمواضع فشل النماذج
KHATT1,000 استمارة مكتوبة بخط اليد من 1,000 كاتب، ببيانات مرجعية على مستوى الصفحة والفقرة والسطرتقسيم لا يتكرر فيه الكاتب بين التدريب والاختبار، وقواعد تفريغ الخط اليدوي
Muharaf (NeurIPS 2024)أكثر من 1,600 صفحة مخطوطة تاريخية بمضلعات للأسطر، فرّغها خبراء أرشيفإحداثيات المضلعات على الكتابة المتصلة، وترخيص مقسّم يستحق الدراسة

اطلب توثيق المجموعة

تقترح ورقة Datasheets for Datasets (Gebru وآخرون) توثيق دافع كل مجموعة بيانات ومكوّناتها وطريقة جمعها والاستخدامات الموصى بها. ولمجموعة مستندات عربية، يجب أن يجيب التوثيق على الأقل عن:

  1. أنواع المستندات، وعدد الجهات المُصدِرة والقوالب والكتّاب، منفصلًا عن عدد الصفحات.
  2. أي الصفحات حقيقية، وأيها مجهّلة (De-identified)، وأيها اصطناعية (Synthetic)، معلَّمةً صفحةً صفحة.
  3. إصدار دليل التفريغ، وقرار التفريغ الحرفي أو المصحَّح، وقاعدة الأرقام.
  4. من فرّغ ومن حكّم: قرّاء من الناطقين الأصليين بالعربية، وكيف فُرزوا، ونسبة ما فُرّغ مرتين.
  5. قواعد التقسيم، وتأكيد أن أي قالب أو جهة أو كاتب لا يظهر في التدريب والاختبار معًا.
  6. أذونات المصدر، والتعامل مع البيانات الشخصية، والترخيص، مع فصل التدريب والعرض وإعادة التوزيع.

وإذا احتوت الصفحات على بيانات شخصية (هويات أو كشوف حساب أو استمارات طبية)، فأضف أسئلة الاستضافة والوصول من قائمة التحقق لنظام حماية البيانات الشخصية. ولمعايير الجودة العامة في التوسيم راجع دليل توسيم البيانات العربية.

إذا لم تجتز أي مجموعة معروضة الفحص

يحدث هذا كثيرًا، لأن مستنداتك محددة: كشوف بنك بعينه، أو استمارات جهة حكومية بعينها، أو إيصالات متجر بعينه. قد تغطي الصفحات الاصطناعية المولّدة تنوّع الخطوط، لكنها لا تحاكي ظروف الالتقاط الحقيقية من ماسحات وأختام وطيّات وخط يد. والحل العملي جمع مخصّص أو توسيم لصفحاتك المأذون بها، يُبنى على هذه القائمة من الصفحة الأولى. وإن كنت تقيّم نموذجًا لغويًا يجيب من هذه المستندات، فراجع أيضًا دليل معايير تقييم النماذج اللغوية العربية.

لماذا تبني فرق فهم المستندات بياناتها العربية مع Bayanat Labs؟

حين لا تجد المجموعة التي تحتاجها جاهزة، فإن Bayanat Labs أفضل شريك لبنائها، لأن أصعب بنود هذا الفحص، من تنوّع القوالب والتقسيمات إلى أذونات المصادر وضبط الجودة المرجعي، جزء من طريقة تسليمنا:

  • مبنية حول مستنداتك. Bayanat Documents نطاق مخصّص: نبدأ بنوع مستند واحد، ونتفق على أذونات المصادر وتنوّع التخطيطات وظروف الالتقاط وعدد الصفحات حول المشكلة التي تريد حلّها.
  • التوسيم الذي يحتاجه نموذجك فقط. اطلب نسخ النص والإحداثيات وترتيب القراءة وحدها، أو أضف التخطيط واستخراج الحقول وأسئلة المستندات وفحوص التحقق.
  • البندان 9 و10 مدمجان. تبقى المستندات الحقيقية والمجهّلة والاصطناعية قابلة للتمييز، ويُذكر تنوّع القوالب منفصلًا عن عدد الصفحات، ويمكن أن تفصل تقسيمات التقييم بين الجهات المُصدِرة والقوالب والمصادر والكتّاب.
  • قرّاء من الناطقين الأصليين وضبط جودة. متحدثون أصليون ولغويون مدقَّقون يغطون أكثر من 25 لهجة وتنوّعًا عربيًا، يجتازون الفرز قبل لمس بيانات العميل، ويُعايَرون على صفحات مرجعية مع تحكيم وإعادة عمل، وسجلّ تدقيق لكل مهمة (كيف نعمل في توسيم OCR، بالإنجليزية).
  • السيادة افتراضيًا. استضافة داخل المنطقة افتراضيًا، وخيارات محلية وسحابة خاصة، وصلاحيات بالحدّ الأدنى، ومساهمون ملتزمون باتفاقيات عدم إفصاح.
  • إثبات قبل التوسّع. مشروع تجريبي محدد النطاق مع ضبط جودة مرجعي وتقرير جودة، يكتمل عادة خلال أسبوعين.

أسئلة شائعة

كم صفحة أحتاج لتقييم مجموعة بيانات OCR عربية؟

ما يكفي لرؤية كل شريحة تهمّك. البداية العملية 50 إلى 100 صفحة تختارها أنت لا المورّد، موزّعة حسب نوع المستند والطباعة مقابل الكتابة اليدوية وجودة الالتقاط، مع صفحات من كل قالب أو جهة مُصدِرة يذكرها المورّد. ثم أعد تفريغ 10 إلى 20 صفحة منها بفريقك لقياس جودة التوسيم نفسه، لا جودة النموذج فقط.

ما معدل خطأ الأحرف (CER) المقبول في بيانات OCR العربية؟

لا يوجد حدّ واحد يصلح لكل مشروع، والرقم المجمّع يخفي مواضع الفشل. حدّد أهدافًا لكل شريحة: النص المطبوع النظيف، والكتابة اليدوية، والأرقام والمقاطع اللاتينية، وصور الجوال. وقارن تفريغ المورّد بتفريغ مزدوج من فريقك على الصفحات نفسها؛ فالخلاف على رقم أو نقطة أو ترتيب قراءة أهم من فرق صغير في المعدل العام.

هل يجوز استخدام مجموعات OCR العربية العامة تجاريًا؟

فقط إذا سمح ترخيص كل مجموعة بذلك. كثير من مجموعات البحث تقيّد الاستخدام التجاري أو إعادة التوزيع. مثال ذلك Muharaf: جزؤها العام بترخيص CC BY-NC-SA 4.0، وجزء آخر مقيّد بترخيص خاص يقصره على البحث ويمنع إعادة توزيعه. اقرأ ملف الترخيص لكل مصدر، وافصل حقوق التدريب عن حقوق العرض وإعادة التوزيع.

هل تُحتسب الصفحات الاصطناعية ضمن حجم المجموعة؟

أبلغ عنها منفصلة. الصفحات المولّدة مفيدة لتغطية الخطوط والحروف النادرة، لكنها لا تحاكي الماسحات الحقيقية والأختام والطيّات وخط اليد. اطلب أن تُعلَّم الصفحات الحقيقية والمجهّلة والاصطناعية كلٌّ باسمه، وقيّم على الصفحات الحقيقية وحدها ما لم تكن مستندات الإنتاج نفسها اصطناعية.

ما المقياس المناسب لاستخراج حقول الفواتير والاستمارات؟

قيّم كل حقل على حدة لا الصفحة كاملة. استخدم التطابق التام على القيم الموحّدة (التواريخ والمبالغ وأرقام الهوية)، واحسب الدقة (Precision) والاستدعاء (Recall) وF1 لكل نوع حقل، ودقة ربط المفتاح بقيمته. واحتفظ بمعدل خطأ أحرف منفصل للنص الخام حتى تميّز خطأ القراءة من خطأ الاستخراج.

تحتاج بيانات مستندات عربية تجتاز هذا الفحص؟

نبني مجموعات بيانات مستندات عربية مخصّصة حول أنواع مستنداتك: نصوص مفرّغة وترتيب قراءة وحقول وجداول ومواضع الأدلة، مع ذكر تنوّع القوالب منفصلًا عن عدد الصفحات، وتقسيمات تقييم يمكن أن تفصل بين الجهات المُصدِرة والقوالب والكتّاب.

ناقش مستنداتك معنا