Target Audience Researchers

تركيب Label Studio لوسم البيانات العربية

مقدمة في بناء مجموعات البيانات العربية نجاح أي نموذج ذكاء اصطناعي (خاصة في المهام الدقيقة للغة العربية) يعتمد بشكل أساسي على جودة البيانات التي تدرب عليها. بالنسبة للباحثين والمؤسسات التي تحتاج لتدريب نماذج مخصصة لاستخراج الكيانات المسماة (Named Entity Recognition…

تثبيت Ollama وتشغيل نموذج عربي على جهازك

الذكاء الاصطناعي على جهازك الشخصي أحد أكبر العوائق التي تواجه الباحثين والمطورين عند تجربة نماذج الذكاء الاصطناعي (LLMs) هو الاعتماد على الخدمات السحابية التي تتطلب اشتراكات مالية، وتثير قلقاً حول خصوصية البيانات (مثل إرسال كود برمجي سري أو بيانات مرضى).…

بناء قاعدة معرفة محادثة بـ AnythingLLM في 30 دقيقة

مقدمة حول قواعد المعرفة التفاعلية في العديد من المنظمات والمؤسسات البحثية، تكون المعرفة مبعثرة عبر مئات الملفات بصيغ PDF ومستندات Word. محاولة البحث فيها يدوياً تعتبر عملية شاقة وغير فعالة. الحل الأمثل هو تحويل هذه الوثائق إلى “قاعدة معرفة محادثة”…

نموذج إرشادي — منظمة تعليمية: تفريغ وترجمة محاضرات (Whisper + LibreTranslate)

مقدمة عن السيناريو سيناريو نمطي لإتاحة محاضرات للصُمّ والناطقين بعدة لغات عبر سلسلة OSS. توصيف المشكلة ساعات محاضرة بالعربية تحتاج لتفريغ نصي (للوصول الشامل) وترجمة (لجمهور أوسع). الترجمة الاحترافية مكلفة وتأخذ شهوراً. الأدوات المستخدمة Whisper.cpp: أداة مستخدمة في سير العمل.…

نموذج إرشادي — وزارة: بحث دلالي عبر وثائق سياسات قديمة (Haystack)

مقدمة عن السيناريو سيناريو نمطي يوضح كيف تستفيد جهة حكومية من بحث دلالي على وثائق سياسات عقود طويلة. توصيف المشكلة آلاف الوثائق التاريخية لقرارات وسياسات مخزّنة في مجلدات شبكية. البحث بالكلمات المفتاحية يفشل لأن المسمّيات تتغيّر مع الزمن. الأدوات المستخدمة…

نموذج إرشادي — بناء مجموعة بيانات NER عربية متخصصة (Label Studio)

مقدمة عن السيناريو سيناريو نمطي يوضح بناء مجموعة بيانات وسم لقطاع معين بواسطة Label Studio وspaCy. توصيف المشكلة غياب نموذج NER عربي متخصص في كيانات قطاع معين (طاقة، صحة، قانون). النماذج العامة تخطئ في تصنيف الأسماء المتخصصة. الأدوات المستخدمة Label…

نموذج إرشادي — مركز بحوث: تفريغ مقابلات ميدانية بالعربية (Whisper.cpp)

مقدمة عن السيناريو يستعرض هذا السيناريو تجربة مركز بحوث اجتماعية افتراضي في استخدام تقنيات الذكاء الاصطناعي لأتمتة تفريغ المقابلات الميدانية الصوتية باللغة العربية، بدلاً من الاعتماد الكلي على العمل اليدوي. توصيف المشكلة يجمع المركز مئات الساعات من المقابلات الميدانية باللغة…

نموذج إرشادي — جامعة: محرك سؤال-جواب على أرشيف الأوراق البحثية (LlamaIndex)

مقدمة عن السيناريو سيناريو نمطي لكلية تبني محرك بحث دلالياً عربياً على أرشيف PDF أكاديمي. توصيف المشكلة أوراق بحثية بصيغة PDF بدون فهرسة دلالية. الباحث الجديد يستغرق وقتاً طويلاً للعثور على أوراق مشابهة لموضوعه. الأدوات المستخدمة LlamaIndex: أداة مستخدمة في…

أنونمة المقابلات البحثية صوت ونص (Whisper.cpp + Ollama)

مقدمة حول سير العمل في الأبحاث الطبية والاجتماعية والإنسانية، يمثل الحفاظ على خصوصية المشاركين في المقابلات أولوية قصوى. يتدخل سير عمل أنونمة المقابلات البحثية (صوت ونص) لأتمتة عملية إزالة المعرفات الشخصية (PII) من الملفات الصوتية والنصوص الناتجة عنها قبل مشاركتها…

بناء ذاكرة ترجمة (TM) من وثائق ثنائية اللغة (Argos Translate + Postgres)

مقدمة حول سير العمل تواجه المنظمات والمؤسسات تحدياً في الحفاظ على اتساق الترجمات عبر السنوات والمشاريع المختلفة. سير العمل بناء ذاكرة ترجمة (Translation Memory) من وثائق ثنائية اللغة يقدم طريقة منهجية لجمع الوثائق السابقة واستخراج أزواج الجمل منها، لإنشاء قاعدة…