بحث دلالي عبر أرشيف الأبحاث بـ LlamaIndex

مقدمة حول سير العمل

الغوص في آلاف الأوراق البحثية لاستخراج معلومة محددة أشبه بالبحث عن إبرة في كومة قش. يحل بحث دلالي عبر أرشيف الأبحاث بـ LlamaIndex هذه المعضلة عبر إنشاء محرك بحث وسؤال-جواب يعتمد على تقنية RAG، لفهرسة الوثائق الأكاديمية والبحث فيها بذكاء.

الهدف من سير العمل

يستهدف النظام تمكين الباحثين من إيجاد المرجع المناسب والإجابة الدقيقة في ثوانٍ. يدعم النظام اللغتين العربية والإنجليزية، ما يسمح بطرح الأسئلة وتلقي الإجابات المدعمة بالاستشهادات من مئات الأوراق البحثية المُفهرسة مسبقاً.

الأدوات والتقنيات المستخدمة

  • LlamaIndex: لتقطيع الوثائق وإدارة سير الاستعلامات (RAG pipeline).
  • Qdrant: قاعدة بيانات متجهات متقدمة وسريعة للبحث التشابهي.
  • Ollama: لتوليد التضمينات (Embeddings) وإنشاء الإجابات بالاستعانة بالنماذج المحلية (مثل bge-m3).
  • Streamlit: لبناء واجهة مستخدم رسومية (UI) أنيقة ومتجاوبة للباحثين.

تفاصيل تنفيذ سير العمل

  • مستوى الصعوبة: متوسط (Intermediate).
  • الوقت المتوقع للإعداد: من 3 إلى 4 أيام.
  • محفز التشغيل (Trigger): الرفع اليدوي للأبحاث بالإضافة لتحديث الفهرسة ليلياً.

خطوات العمل (الآلية)

  1. جمع ملفات الـ PDF البحثية في مجلد مخصص وتمريرها عبر أداة قراءة (PDFReader).
  2. استخدام مقطّع الجمل (SentenceSplitter) لتقسيم النصوص إلى أجزاء صغيرة (حوالي 800 حرف).
  3. توليد المتجهات الرقمية لكل جزء باستخدام OllamaEmbedding.
  4. فهرسة هذه البيانات وحفظها في قاعدة بيانات Qdrant.
  5. إعداد محرك استعلام (QueryEngine) يجلب أفضل 8 نتائج مشابهة للسؤال (top_k=8) مع إعادة ترتيبها (Rerank).
  6. ربط المحرك بواجهة Streamlit ثنائية اللغة ليتمكن الباحثون من طرح أسئلتهم بسهولة.

الخلاصة

يضع هذا النظام قوة الذكاء الاصطناعي التوليدي في خدمة البحث العلمي بشكل آمن ومغلق. لن يضطر الباحثون لرفع ملفاتهم السرية إلى الإنترنت؛ فكل شيء يعمل محلياً بسرعة وبدقة لتوفير مراجع وإجابات موثقة تعزز من إنتاجيتهم الأكاديمية.