مقدمة حول سير العمل
إعداد Label Studio لتصنيف نصوص عربية (تقارير، شكاوى، حالات) يدوياً ثم تدريب مصنّف بسيط للأتمتة المستقبلية.
الهدف من سير العمل
بناء أصل بيانات عربي مُسمَّى يمكن للمنظمة استخدامه لتصنيف الوثائق الجديدة آلياً مع الوقت.
الأدوات والتقنيات المستخدمة
تم استخدام الأدوات التالية: Label Studio و n8n و WordPress
تفاصيل تنفيذ سير العمل
- مستوى الصعوبة: moderate
- الوقت المتوقع للإعداد: 5–8 ساعات للإعداد، ثم وقت مستمر للتصنيف
- محفز التشغيل (Trigger): manual لكل دفعة تصنيف
خطوات العمل (الآلية)
- تشغيل Label Studio محلياً: docker run -p 8080:8080 -v $(pwd)/data:/label-studio/data heartexlabs/label-studio
- إنشاء project جديد، اختيار Text Classification (Multi-class).
- تعريف labels واضحة (5–8 categories كحد أقصى للبداية، يمكن التوسّع لاحقاً).
- كتابة Labeling Instructions تفصيلية للمصنّفين (أمثلة + حالات حدّية + ما لا يُصنَّف).
- رفع دفعة أولى من 50–100 وثيقة كاختبار، وتصنيفها بنفسك للتحقق من وضوح التعليمات.
- دعوة المصنّفين، إعطاؤهم vodcument shared للتعليمات، وبدء التصنيف.
- مراجعة inter-rater agreement بعد أول 100 وثيقة (نسبة الاتفاق بين المصنّفين). إذا أقل من 75%، حسّن التعليمات.
- تصدير البيانات كـ JSON أو CSV. ابدأ بعد 500+ وثيقة بتدريب نموذج بسيط للأتمتة الجزئية.
وصف مفصل
كثير من المنظمات تتعامل مع تدفّق وثائق متشابهة (شكاوى حقوقية، حالات لاجئين، طلبات استشارة قانونية). تصنيف هذه الوثائق يدوياً أصبح غير قابل للتوسّع. الحل بعيد المدى: تدريب مصنّف على البيانات الخاصة بالمنظمة. لكن قبل أن تُدرّب أي شيء، تحتاج إلى بيانات مُسمّاة بدقة. Label Studio أداة مفتوحة المصدر متخصّصة لهذا. الـ workflow يبدأ بـ Label Studio محلي (Docker)، تُعرَّف فيه labels واضحة (مثلاً: نوع الحالة، درجة الإلحاح، البلد، نوع الانتهاك). الفريق يصنّف 200–500 وثيقة كدفعة أولى. هذه البيانات تصبح أصلاً قيّماً قابلاً لـ: – التدريب لاحقاً – التحليل الإحصائي (ما هي الفئات الأكثر شيوعاً) – المشاركة مع شركاء البحث (مع احترام الخصوصية) ملاحظة حساسة: تصنيف الوثائق التي تحتوي بيانات شخصية يتطلب احتياطات: استضافة Label Studio في شبكة المنظمة الخاصة فقط، حذف البيانات الشخصية قبل التصنيف، اتفاقيات سرّية مع المُصنِّفين. بعد جمع 500–1000 وثيقة مُسمّاة، يصبح ممكناً ضبط نموذج بسيط (مثل BERT العربي AraBERT أو نموذج مفتوح أحدث) لتصنيف الوثائق الجديدة آلياً. هذا خطوة متقدمة تستحق case study مستقلة.