مشروع چراغ (cheRAGh)
“أضأنا مصباح البحث في ليل الأسئلة،
ليظهر من نوره طريق الإجابات عبر التحديات”

المعيار الشامل لأنظمة التوليد المعزز بالاسترجاع (RAG) في اللغة الفارسية
چراغ (cheRAGh) هو مجموعة من المعايير القياسية لتقييم مكونات وأنظمة التوليد المعزز بالاسترجاع (Retrieval-Augmented Generation) في اللغة الفارسية. من خلال توفير قواعد بيانات متخصصة، ومعايير تقييم قياسية، ولوحات متصدرين، يقدم هذا المشروع منصة موحدة لمقارنة وتحليل وتطوير نماذج وأنظمة RAG الفارسية.
هدف چراغ هو إنشاء مرجع مفتوح المصدر، وشفاف، وقابل لإعادة الإنتاج للباحثين والمطورين والمؤسسات التي تبحث عن تقييم عادل لنماذج الاسترجاع، ونماذج التضمين (Embedding)، وإعادة الترتيب (Reranking)، والمكونات الأخرى لأنظمة RAG.
من خلال تغطية مجالات مختلفة بما في ذلك القانوني، والديني، والعلمي، والتعليمي، والعام، يسعى چراغ لتقديم صورة دقيقة لأداء النماذج في التطبيقات الواقعية وإتاحة مقارنتها بناءً على معايير قياسية.
ما هو چراغ وما هي استخداماته؟
تتكون أنظمة التوليد المعزز بالاسترجاع (RAG) من عدة مكونات مستقلة مثل نماذج التضمين (Embedding)، والاسترجاع (Retrieval)، وإعادة الترتيب (Reranking)، والنماذج اللغوية الكبيرة (LLMs). تعتمد جودة الاستجابة النهائية لهذه الأنظمة على أداء كل من هذه المكونات؛ وبالتالي، فإن تقييمها العادل ممكن فقط إذا كان مبنيًا على قواعد بيانات قياسية، ومعايير قياس واضحة، وعملية قابلة لإعادة الإنتاج.
تم تطوير چراغ (cheRAGh) بهدف إنشاء مرجع شامل وقياسي لتقييم أنظمة RAG الفارسية. يوفر هذا المشروع مجموعة من المعايير المستقلة والمكملة، يقيم كل منها أحد المكونات الرئيسية لنظام RAG. تتم جميع التقييمات بناءً على قواعد بيانات فارسية، ومعايير قياسية، وعمليات شفافة لضمان أن تكون النتائج موثوقة، وقابلة للمقارنة، وقابلة لإعادة الإنتاج.
حاليًا، تم نشر المعيار الأول لمشروع چراغ، المخصص لتقييم نماذج التضمين (Embedding)، وهو متاح للباحثين والمطورين عبر صفحة Embedding Benchmark. يقارن هذا المعيار أداء النماذج المختلفة من حيث جودة استرجاع المعلومات باللغة الفارسية. كما أن معايير چراغ الأخرى، بما في ذلك تقييم نماذج Reranker، وأنظمة Retrieval، والنماذج اللغوية الكبيرة (LLMs)، ومكونات أخرى من سلسلة RAG، هي قيد التطوير وسيتم إضافتها تدريجيًا إلى المجموعة.
المجالات المغطاة (النطاقات)
لضمان أن تمثل التقييمات التطبيقات الواقعية، تغطي قواعد بيانات چراغ خمسة مجالات مهمة:
قانوني
القوانين، واللوائح، والوثائق القانونية.
ديني
النصوص الإسلامية والأسئلة الدينية.
علمي
ملخصات ونصوص الأوراق الأكاديمية.
تعليمي
الكتب المدرسية والموارد التعليمية.
عام
الأسئلة وتفاعلات المستخدمين اليومية.
تم اختيار هذه المجالات بهدف تغطية مجموعة متنوعة من أساليب الكتابة، والمفردات، وتعقيد المفاهيم، والاحتياجات المعلوماتية في اللغة الفارسية. وبالتالي، فإن نتائج چراغ لا تعكس فقط أداء النموذج في مجال معين، بل تقدم صورة أكثر شمولاً لقدراته في التطبيقات المختلفة.
علاوة على ذلك، يستخدم چراغ مقاييس تقييم مصممة خصيصًا لكل مهمة في كل معيار. على سبيل المثال، في معيار Embedding، يتم استخدام مقاييس Mean Reciprocal Rank (MRR) و Recall@5 لقياس جودة الترتيب والقدرة على استرجاع المستندات الصحيحة. وفي المعايير الأخرى، سيتم استخدام مقاييس متخصصة أخرى تتناسب مع طبيعة المهمة لتقييم كل مكون بناءً على المؤشرات التي تقدم أدق صورة لأدائه الفعلي.
يوفر چراغ منصة مناسبة للباحثين والمطورين والمؤسسات لمقارنة النماذج والأنظمة المختلفة بطريقة قياسية وموثوقة، وتحديد نقاط القوة والضعف لديها في مجالات مختلفة، وتتبع تقدمها بمرور الوقت. الهدف النهائي لهذا المشروع هو إنشاء مرجع موثوق لتقييم أنظمة RAG الفارسية والمساعدة في تطوير أبحاث ومنتجات الذكاء الاصطناعي القائمة على اللغة الفارسية.
معايير (Benchmarks) مشروع چراغ
يقدم چراغ مجموعة من المعايير المستقلة والمكملة التي يقيم كل منها إحدى المراحل الرئيسية لنظام Retrieval-Augmented Generation (RAG). يحتوي كل معيار على قواعد بياناته الخاصة، ومقاييس التقييم، ولوحة المتصدرين، ويتم نشره وتحديثه بشكل مستقل. مجتمعة، تقدم هذه المعايير صورة شاملة لأداء أنظمة RAG الفارسية، من مرحلة استرجاع المعلومات إلى توليد الاستجابة النهائية.
يقيم هذا المعيار جودة نماذج التضمين في التمثيل الدلالي للنصوص الفارسية واسترجاع المستندات ذات الصلة. يتم اختبار النماذج على قواعد بيانات چراغ متعددة المجالات، ويتم الإبلاغ عن أدائها باستخدام مقاييس مثل MRR و Recall@5.
الحالة: ✅ منشور
عرض المعيار:
https://huggingface.co/spaces/QomSSLab/cheRAGh-Embedding
بعد الاسترجاع الأولي، تتولى نماذج إعادة الترتيب مسؤولية إعادة ترتيب المستندات المسترجعة بناءً على مدى صلتها بالاستعلام. يقيم هذا المعيار قدرة نماذج Reranker على تحسين جودة نتائج الاسترجاع وزيادة دقة أنظمة RAG.
الحالة: 🚧 قيد التطوير
في العديد من أنظمة RAG، يجب أن يكون النموذج اللغوي قادرًا على اختيار واستدعاء الأدوات المناسبة للإجابة. يقيم هذا المعيار قدرة النماذج على اختيار الأداة الصحيحة، وتوليد استدعاء صالح، واستخدام مخرجات الأداة، ومواصلة عملية الاستدلال والإجابة.
الحالة: 🚧 قيد التطوير
يقيم هذا المعيار الأداء الكامل لأنظمة RAG من تلقي الاستعلام إلى توليد الاستجابة النهائية. في هذا القسم، يتم تقييم جميع مكونات النظام، بما في ذلك الاسترجاع، وإعادة الترتيب، واستخدام الأدوات، وتوليد الاستجابة بشكل متكامل لتحديد الجودة النهائية للنظام في السيناريوهات الواقعية. يتيح هذا المعيار المقارنة المباشرة لأنظمة RAG المختلفة ويقدم صورة شاملة لأدائها في التطبيقات العملية.
الحالة: 🚧 قيد التطوير
تغطي هذه المعايير الأربعة المراحل الرئيسية لنظام RAG وتشكل معًا منصة شاملة لتقييم ومقارنة نماذج وأنظمة RAG الفارسية. مع تطور مشروع چراغ، ستتم إضافة قواعد بيانات جديدة، ومقاييس تقييم، ونماذج إضافية، وتقارير تحليلية إلى كل من هذه المعايير.
