مقدمة حول سير العمل
في الأبحاث الطبية والاجتماعية والإنسانية، يمثل الحفاظ على خصوصية المشاركين في المقابلات أولوية قصوى. يتدخل سير عمل أنونمة المقابلات البحثية (صوت ونص) لأتمتة عملية إزالة المعرفات الشخصية (PII) من الملفات الصوتية والنصوص الناتجة عنها قبل مشاركتها مع الجمهور أو الباحثين الآخرين.
الهدف من سير العمل
الهدف الأساسي هو مشاركة نصوص وتسجيلات بحثية حساسة دون انتهاك خصوصية المشاركين. من خلال حجب الأسماء، الأماكن، والتواريخ آلياً من الصوت والنص، يُسرّع النظام عمليات الموافقة الأخلاقية وإتاحة البيانات.
الأدوات والتقنيات المستخدمة
- Whisper.cpp: لتفريغ الملفات الصوتية مع الحفاظ على التوقيت الدقيق لكل كلمة (Word timestamps).
- Ollama: لاكتشاف وإخفاء البيانات الحساسة من النصوص.
- Pydub / FFmpeg: لمعالجة الملفات الصوتية وإضافة أصوات تشويش (Bleep) على الكلمات المحجوبة.
- n8n & MinIO: لإدارة مسار العمل وحفظ الملفات بشكل آمن.
تفاصيل تنفيذ سير العمل
- مستوى الصعوبة: متقدم (Advanced).
- الوقت المتوقع للإعداد: حوالي أسبوع لضمان الدقة في المزامنة الزمنية والتعرف.
- محفز التشغيل (Trigger): يتم تحفيزه عند رفع ملف صوتي جديد (Upload audio) إلى المجلد المخصص للبحث.
خطوات العمل (الآلية)
- رفع التسجيل الصوتي (MP3) إلى بيئة MinIO الآمنة.
- استخدام Whisper.cpp لاستخراج النص مع توليد طابع زمني دقيق لكل كلمة تم النطق بها.
- توجيه النص لـ Ollama الذي يقوم بفحص واستخراج أي بيانات شخصية (أسماء، تواريخ، مهن، مواقع).
- استبدال كل بيان حساس برمز تصنيفي عام (مثلاً: [NAME]، [LOCATION]).
- استخدام المكتبات الصوتية لتشويش أو طمس المقطع الصوتي المطابق للكلمة المحذوفة بناءً على الطابع الزمني.
- إخراج ملفين نهائيين: نص مكتوب (Redacted TXT) وملف صوتي مُعالج (Redacted MP3).
- مرور الملفات عبر نقطة مراجعة بشرية (Human review checkpoint) للاعتماد النهائي.
- نشر الملفات المُنقّحة في أرشيف الأبحاث لمشاركتها بأمان.
الخلاصة
تعتبر هذه الأتمتة المتقدمة إنجازاً أخلاقياً وعملياً في ذات الوقت. فهي تزيل عبء ساعات طويلة من التحرير اليدوي المعقد للصوت والنصوص، وتقدم حلاً تقنياً حصيناً يدعم النزاهة البحثية ويصون خصوصية المصادر.