Sector Research

بحث دلالي عبر أرشيف الأبحاث بـ LlamaIndex

مقدمة حول سير العمل الغوص في آلاف الأوراق البحثية لاستخراج معلومة محددة أشبه بالبحث عن إبرة في كومة قش. يحل بحث دلالي عبر أرشيف الأبحاث بـ LlamaIndex هذه المعضلة عبر إنشاء محرك بحث وسؤال-جواب يعتمد على تقنية RAG، لفهرسة الوثائق…

بناء مجموعة بيانات NER عربية للأخبار (Label Studio + spaCy)

مقدمة حول سير العمل وسم 5000 مقال، تصدير COCO/JSON، تدريب نموذج spaCy عربي محلي. الهدف من سير العمل إنتاج نموذج NER عربي خاص بقطاع محدّد (إنساني، صحي، اقتصادي). الأدوات والتقنيات المستخدمة تم استخدام الأدوات التالية: Label Studio و spaCy و…

إنشاء “محادثة مع وثائقك” بـ LlamaIndex في 50 سطر

مقدمة في بناء تطبيقات RAG بأقل كود ممكن يتزايد الطلب على بناء تطبيقات المحادثة مع البيانات الداخلية بسرعة هائلة. بالنسبة للمطورين والباحثين، كتابة آلاف الأسطر البرمجية لبناء هذه الأنظمة ليس أمراً عملياً. هنا تبرز مكتبة LlamaIndex (سابقاً GPT Index) كأحد…

بناء أول خط RAG إنتاجي بـ Haystack

مقدمة في بناء RAG الإنتاجي بناء نظام RAG (Retrieval-Augmented Generation) للنماذج التجريبية أمر سهل، ولكن نقله إلى بيئة إنتاجية (Production) موثوقة يتعامل مع ملفات PDF عربية ويقدم إجابات موثقة يتطلب إطار عمل معماري صلب. يبرز Haystack (من تطوير deepset) كأحد…

تركيب Label Studio لوسم البيانات العربية

مقدمة في بناء مجموعات البيانات العربية نجاح أي نموذج ذكاء اصطناعي (خاصة في المهام الدقيقة للغة العربية) يعتمد بشكل أساسي على جودة البيانات التي تدرب عليها. بالنسبة للباحثين والمؤسسات التي تحتاج لتدريب نماذج مخصصة لاستخراج الكيانات المسماة (Named Entity Recognition…

نموذج إرشادي — بناء مجموعة بيانات NER عربية متخصصة (Label Studio)

مقدمة عن السيناريو سيناريو نمطي يوضح بناء مجموعة بيانات وسم لقطاع معين بواسطة Label Studio وspaCy. توصيف المشكلة غياب نموذج NER عربي متخصص في كيانات قطاع معين (طاقة، صحة، قانون). النماذج العامة تخطئ في تصنيف الأسماء المتخصصة. الأدوات المستخدمة Label…

نموذج إرشادي — مركز بحوث: تفريغ مقابلات ميدانية بالعربية (Whisper.cpp)

مقدمة عن السيناريو يستعرض هذا السيناريو تجربة مركز بحوث اجتماعية افتراضي في استخدام تقنيات الذكاء الاصطناعي لأتمتة تفريغ المقابلات الميدانية الصوتية باللغة العربية، بدلاً من الاعتماد الكلي على العمل اليدوي. توصيف المشكلة يجمع المركز مئات الساعات من المقابلات الميدانية باللغة…

نموذج إرشادي — جامعة: محرك سؤال-جواب على أرشيف الأوراق البحثية (LlamaIndex)

مقدمة عن السيناريو سيناريو نمطي لكلية تبني محرك بحث دلالياً عربياً على أرشيف PDF أكاديمي. توصيف المشكلة أوراق بحثية بصيغة PDF بدون فهرسة دلالية. الباحث الجديد يستغرق وقتاً طويلاً للعثور على أوراق مشابهة لموضوعه. الأدوات المستخدمة LlamaIndex: أداة مستخدمة في…

أنونمة المقابلات البحثية صوت ونص (Whisper.cpp + Ollama)

مقدمة حول سير العمل في الأبحاث الطبية والاجتماعية والإنسانية، يمثل الحفاظ على خصوصية المشاركين في المقابلات أولوية قصوى. يتدخل سير عمل أنونمة المقابلات البحثية (صوت ونص) لأتمتة عملية إزالة المعرفات الشخصية (PII) من الملفات الصوتية والنصوص الناتجة عنها قبل مشاركتها…

مساعد مراجعة أدبيات أسبوعي للباحثين (arXiv RSS + LlamaIndex + Notion)

مقدمة حول سير العمل بسبب الحجم الهائل للأوراق البحثية التي تُنشر يومياً على منصات مثل arXiv، يقضي الباحثون ساعات طويلة في التصفح لاختيار ما يستحق القراءة. مساعد مراجعة أدبيات أسبوعي للباحثين هو نظام ذكي يتكفل بمهمة التصفية، القراءة، والتلخيص نيابة…