پروژه چراغ (cheRAGh)
“چراغِ جستوجو افروختیم در شامِ پرسشها
که پیدا گردد از نورش، رهِ پاسخ زِ چالشها”

محک جامع سامانههای بازیابی تقویتشده با تولید (RAG) در زبان فارسی
چراغ (cheRAGh) مجموعهای از بنچمارکهای استاندارد برای ارزیابی مؤلفهها و سامانههای Retrieval-Augmented Generation (RAG) در زبان فارسی است. این پروژه با ارائه مجموعهدادههای تخصصی، معیارهای ارزیابی استاندارد و جدولهای رتبهبندی، بستری یکپارچه برای مقایسه، تحلیل و توسعه مدلها و سامانههای RAG فارسی فراهم میکند.
هدف چراغ، ایجاد مرجعی متنباز، شفاف و بازتولیدپذیر برای پژوهشگران، توسعهدهندگان و سازمانهایی است که به دنبال ارزیابی منصفانه مدلهای بازیابی، مدلهای تعبیهسازی (Embedding)، بازرتبهبندی (Reranking) و سایر اجزای سامانههای RAG هستند.
چراغ با پوشش حوزههای مختلف از جمله حقوقی، دینی، علمی، آموزشی و عمومی، تلاش میکند تصویری دقیق از عملکرد مدلها در کاربردهای واقعی ارائه دهد و امکان مقایسه آنها را بر پایه معیارهای استاندارد فراهم سازد.
چراغ چیست و چه کاربردی دارد؟
سامانههای Retrieval-Augmented Generation (RAG) از چندین مؤلفه مستقل مانند مدلهای تعبیهسازی (Embedding)، بازیابی (Retrieval)، بازرتبهبندی (Reranking) و مدلهای زبانی بزرگ (LLM) تشکیل شدهاند. کیفیت پاسخ نهایی این سامانهها به عملکرد هر یک از این اجزا وابسته است؛ ازاینرو، ارزیابی منصفانه آنها تنها در صورتی امکانپذیر است که بر پایه مجموعهدادههای استاندارد، معیارهای سنجش مشخص و فرآیندی بازتولیدپذیر انجام شود.
چراغ (cheRAGh) با هدف ایجاد یک مرجع جامع و استاندارد برای ارزیابی سامانههای RAG فارسی توسعه یافته است. این پروژه مجموعهای از بنچمارکهای مستقل و مکمل را ارائه میکند که هر یک یکی از اجزای اصلی یک سامانه RAG را مورد ارزیابی قرار میدهند. تمامی ارزیابیها بر پایه مجموعهدادههای فارسی، معیارهای استاندارد و فرآیندهای شفاف انجام میشوند تا نتایج حاصل، قابل اعتماد، قابل مقایسه و قابل بازتولید باشند.
در حال حاضر، نخستین بنچمارک پروژه چراغ، ویژه ارزیابی مدلهای تعبیهسازی (Embedding) منتشر شده و از طریق صفحه Embedding Benchmark در دسترس پژوهشگران و توسعهدهندگان قرار دارد. این بنچمارک عملکرد مدلهای مختلف را از منظر کیفیت بازیابی اطلاعات در زبان فارسی مقایسه میکند. سایر بنچمارکهای چراغ، از جمله ارزیابی مدلهای Reranker، سامانههای Retrieval، مدلهای زبانی بزرگ (LLM) و سایر اجزای زنجیره RAG نیز در مراحل توسعه قرار دارند و بهتدریج به مجموعه افزوده خواهند شد.
حوزههای تحت پوشش (دامنهها)
برای آنکه ارزیابیها نمایانگر کاربردهای واقعی باشند، مجموعهدادههای چراغ پنج دامنه مهم را پوشش میدهند:
حقوقی
شامل قوانین، آییننامهها، مقررات و سایر اسناد حقوقی که نیازمند بازیابی دقیق و حساس به اصطلاحات تخصصی هستند.
دینی
شامل قرآن کریم، احادیث، متون اسلامی و پرسشهای دینی که علاوه بر واژگان تخصصی، به دقت معنایی بالایی نیاز دارند.
علمی
شامل چکیدهها و متون علمی که توانایی مدلها را در درک مفاهیم تخصصی، اصطلاحات علمی و روابط معنایی ارزیابی میکند.
آموزشی
شامل کتابهای درسی و منابع آموزشی که بازتابدهنده پرسشهای آموزشی و مفاهیم مورد استفاده در محیطهای یادگیری هستند.
عمومی
شامل پرسشها و متون عمومی با موضوعات متنوع که عملکرد مدلها را در سناریوهای روزمره و کاربردهای عمومی میسنجد.
انتخاب این دامنهها با این هدف انجام شده است که مجموعهای متنوع از سبکهای نگارش، واژگان، پیچیدگی مفاهیم و نیازهای اطلاعاتی زبان فارسی پوشش داده شود. بدین ترتیب، نتایج چراغ تنها بیانگر عملکرد یک مدل در یک حوزه خاص نیست، بلکه تصویری جامعتر از توانایی آن در کاربردهای مختلف ارائه میدهد.
از سوی دیگر، چراغ برای هر بنچمارک از معیارهای ارزیابی متناسب با همان وظیفه استفاده میکند. برای نمونه، در بنچمارک Embedding، معیارهای Mean Reciprocal Rank (MRR) و Recall@5 برای سنجش کیفیت رتبهبندی و توانایی بازیابی اسناد صحیح بهکار گرفته شدهاند. در سایر بنچمارکها نیز، متناسب با ماهیت وظیفه، معیارهای تخصصی دیگری مورد استفاده قرار خواهند گرفت تا هر مؤلفه بر اساس شاخصهایی ارزیابی شود که دقیقترین تصویر از عملکرد واقعی آن ارائه میکنند.
چراغ بستری مناسب برای پژوهشگران، توسعهدهندگان و سازمانها فراهم میکند تا مدلها و سامانههای مختلف را با روشی استاندارد و قابل استناد مقایسه کنند، نقاط قوت و ضعف آنها را در حوزههای مختلف شناسایی نمایند و روند پیشرفت آنها را در طول زمان دنبال کنند. هدف نهایی این پروژه، ایجاد مرجعی معتبر برای ارزیابی سامانههای RAG فارسی و کمک به توسعه پژوهشها و محصولات هوش مصنوعی مبتنی بر زبان فارسی است.
بنچمارکهای پروژه چراغ
چراغ مجموعهای از بنچمارکهای مستقل و مکمل را ارائه میکند که هر یک یکی از مراحل اصلی یک سامانه Retrieval-Augmented Generation (RAG) را مورد ارزیابی قرار میدهند. هر بنچمارک دارای مجموعهدادهها، معیارهای ارزیابی و جدول رتبهبندی اختصاصی خود است و بهصورت مستقل منتشر و بهروزرسانی میشود. در کنار یکدیگر، این بنچمارکها تصویری جامع از عملکرد سامانههای RAG فارسی، از مرحله بازیابی اطلاعات تا تولید پاسخ نهایی، ارائه میکنند.
این بنچمارک کیفیت مدلهای تعبیهسازی را در نمایش معنایی متون فارسی و بازیابی اسناد مرتبط ارزیابی میکند. مدلها بر روی مجموعهدادههای چندحوزهای چراغ آزموده شده و عملکرد آنها با معیارهایی مانند MRR و Recall@5 گزارش میشود.
وضعیت: ✅ منتشر شده
مشاهده بنچمارک:
https://huggingface.co/spaces/QomSSLab/cheRAGh-Embedding
پس از بازیابی اولیه، مدلهای بازرتبهبندی وظیفه دارند اسناد بازیابیشده را بر اساس میزان ارتباط با پرسش مجدداً مرتب کنند. این بنچمارک توانایی مدلهای Reranker را در بهبود کیفیت نتایج بازیابی و افزایش دقت سامانههای RAG ارزیابی میکند.
وضعیت: 🚧 در حال توسعه
در بسیاری از سامانههای RAG، مدل زبانی باید بتواند ابزارهای مناسب را برای پاسخگویی انتخاب و فراخوانی کند. این بنچمارک توانایی مدلها را در انتخاب ابزار صحیح، تولید فراخوان معتبر، استفاده از خروجی ابزار و ادامه فرآیند استدلال و پاسخگویی ارزیابی میکند.
وضعیت: 🚧 در حال توسعه
این بنچمارک عملکرد کامل سامانههای RAG را از دریافت پرسش تا تولید پاسخ نهایی ارزیابی میکند. در این بخش، تمامی اجزای سامانه شامل بازیابی، بازرتبهبندی، استفاده از ابزارها و تولید پاسخ بهصورت یکپارچه سنجیده میشوند تا کیفیت نهایی سامانه در سناریوهای واقعی مشخص شود. این بنچمارک امکان مقایسه مستقیم سامانههای RAG مختلف را فراهم کرده و تصویری جامع از عملکرد آنها در کاربردهای عملی ارائه میدهد.
وضعیت: 🚧 در حال توسعه
این چهار بنچمارک، مراحل اصلی یک سامانه RAG را پوشش میدهند و در کنار یکدیگر، بستری جامع برای ارزیابی و مقایسه مدلها و سامانههای RAG فارسی فراهم میکنند. با توسعه پروژه چراغ، مجموعهدادههای جدید، معیارهای ارزیابی، مدلهای بیشتر و گزارشهای تحلیلی به هر یک از این بنچمارکها افزوده خواهد شد.