محک جامع سامانه‌های بازیابی تقویت‌شده با تولید (RAG) در زبان فارسی

پروژه چراغ (cheRAGh)

“چراغِ جست‌وجو افروختیم در شامِ پرسش‌ها
که پیدا گردد از نورش، رهِ پاسخ زِ چالش‌ها”

محک جامع سامانه‌های بازیابی تقویت‌شده با تولید (RAG) در زبان فارسی

چراغ (cheRAGh) مجموعه‌ای از بنچمارک‌های استاندارد برای ارزیابی مؤلفه‌ها و سامانه‌های Retrieval-Augmented Generation (RAG) در زبان فارسی است. این پروژه با ارائه مجموعه‌داده‌های تخصصی، معیارهای ارزیابی استاندارد و جدول‌های رتبه‌بندی، بستری یکپارچه برای مقایسه، تحلیل و توسعه مدل‌ها و سامانه‌های RAG فارسی فراهم می‌کند.

هدف چراغ، ایجاد مرجعی متن‌باز، شفاف و بازتولیدپذیر برای پژوهشگران، توسعه‌دهندگان و سازمان‌هایی است که به دنبال ارزیابی منصفانه مدل‌های بازیابی، مدل‌های تعبیه‌سازی (Embedding)، بازرتبه‌بندی (Reranking) و سایر اجزای سامانه‌های RAG هستند.

چراغ با پوشش حوزه‌های مختلف از جمله حقوقی، دینی، علمی، آموزشی و عمومی، تلاش می‌کند تصویری دقیق از عملکرد مدل‌ها در کاربردهای واقعی ارائه دهد و امکان مقایسه آن‌ها را بر پایه معیارهای استاندارد فراهم سازد.

چراغ چیست و چه کاربردی دارد؟

سامانه‌های Retrieval-Augmented Generation (RAG) از چندین مؤلفه مستقل مانند مدل‌های تعبیه‌سازی (Embedding)، بازیابی (Retrieval)، بازرتبه‌بندی (Reranking) و مدل‌های زبانی بزرگ (LLM) تشکیل شده‌اند. کیفیت پاسخ نهایی این سامانه‌ها به عملکرد هر یک از این اجزا وابسته است؛ ازاین‌رو، ارزیابی منصفانه آن‌ها تنها در صورتی امکان‌پذیر است که بر پایه مجموعه‌داده‌های استاندارد، معیارهای سنجش مشخص و فرآیندی بازتولیدپذیر انجام شود.

چراغ (cheRAGh) با هدف ایجاد یک مرجع جامع و استاندارد برای ارزیابی سامانه‌های RAG فارسی توسعه یافته است. این پروژه مجموعه‌ای از بنچمارک‌های مستقل و مکمل را ارائه می‌کند که هر یک یکی از اجزای اصلی یک سامانه RAG را مورد ارزیابی قرار می‌دهند. تمامی ارزیابی‌ها بر پایه مجموعه‌داده‌های فارسی، معیارهای استاندارد و فرآیندهای شفاف انجام می‌شوند تا نتایج حاصل، قابل اعتماد، قابل مقایسه و قابل بازتولید باشند.

در حال حاضر، نخستین بنچمارک پروژه چراغ، ویژه ارزیابی مدل‌های تعبیه‌سازی (Embedding) منتشر شده و از طریق صفحه Embedding Benchmark در دسترس پژوهشگران و توسعه‌دهندگان قرار دارد. این بنچمارک عملکرد مدل‌های مختلف را از منظر کیفیت بازیابی اطلاعات در زبان فارسی مقایسه می‌کند. سایر بنچمارک‌های چراغ، از جمله ارزیابی مدل‌های Reranker، سامانه‌های Retrieval، مدل‌های زبانی بزرگ (LLM) و سایر اجزای زنجیره RAG نیز در مراحل توسعه قرار دارند و به‌تدریج به مجموعه افزوده خواهند شد.

حوزه‌های تحت پوشش (دامنه‌ها)

برای آنکه ارزیابی‌ها نمایانگر کاربردهای واقعی باشند، مجموعه‌داده‌های چراغ پنج دامنه مهم را پوشش می‌دهند:

⚖️

حقوقی

شامل قوانین، آیین‌نامه‌ها، مقررات و سایر اسناد حقوقی که نیازمند بازیابی دقیق و حساس به اصطلاحات تخصصی هستند.

🕌

دینی

شامل قرآن کریم، احادیث، متون اسلامی و پرسش‌های دینی که علاوه بر واژگان تخصصی، به دقت معنایی بالایی نیاز دارند.

🔬

علمی

شامل چکیده‌ها و متون علمی که توانایی مدل‌ها را در درک مفاهیم تخصصی، اصطلاحات علمی و روابط معنایی ارزیابی می‌کند.

📚

آموزشی

شامل کتاب‌های درسی و منابع آموزشی که بازتاب‌دهنده پرسش‌های آموزشی و مفاهیم مورد استفاده در محیط‌های یادگیری هستند.

🌐

عمومی

شامل پرسش‌ها و متون عمومی با موضوعات متنوع که عملکرد مدل‌ها را در سناریوهای روزمره و کاربردهای عمومی می‌سنجد.

انتخاب این دامنه‌ها با این هدف انجام شده است که مجموعه‌ای متنوع از سبک‌های نگارش، واژگان، پیچیدگی مفاهیم و نیازهای اطلاعاتی زبان فارسی پوشش داده شود. بدین ترتیب، نتایج چراغ تنها بیانگر عملکرد یک مدل در یک حوزه خاص نیست، بلکه تصویری جامع‌تر از توانایی آن در کاربردهای مختلف ارائه می‌دهد.

از سوی دیگر، چراغ برای هر بنچمارک از معیارهای ارزیابی متناسب با همان وظیفه استفاده می‌کند. برای نمونه، در بنچمارک Embedding، معیارهای Mean Reciprocal Rank (MRR) و Recall@5 برای سنجش کیفیت رتبه‌بندی و توانایی بازیابی اسناد صحیح به‌کار گرفته شده‌اند. در سایر بنچمارک‌ها نیز، متناسب با ماهیت وظیفه، معیارهای تخصصی دیگری مورد استفاده قرار خواهند گرفت تا هر مؤلفه بر اساس شاخص‌هایی ارزیابی شود که دقیق‌ترین تصویر از عملکرد واقعی آن ارائه می‌کنند.

چراغ بستری مناسب برای پژوهشگران، توسعه‌دهندگان و سازمان‌ها فراهم می‌کند تا مدل‌ها و سامانه‌های مختلف را با روشی استاندارد و قابل استناد مقایسه کنند، نقاط قوت و ضعف آن‌ها را در حوزه‌های مختلف شناسایی نمایند و روند پیشرفت آن‌ها را در طول زمان دنبال کنند. هدف نهایی این پروژه، ایجاد مرجعی معتبر برای ارزیابی سامانه‌های RAG فارسی و کمک به توسعه پژوهش‌ها و محصولات هوش مصنوعی مبتنی بر زبان فارسی است.

بنچمارک‌های پروژه چراغ

چراغ مجموعه‌ای از بنچمارک‌های مستقل و مکمل را ارائه می‌کند که هر یک یکی از مراحل اصلی یک سامانه Retrieval-Augmented Generation (RAG) را مورد ارزیابی قرار می‌دهند. هر بنچمارک دارای مجموعه‌داده‌ها، معیارهای ارزیابی و جدول رتبه‌بندی اختصاصی خود است و به‌صورت مستقل منتشر و به‌روزرسانی می‌شود. در کنار یکدیگر، این بنچمارک‌ها تصویری جامع از عملکرد سامانه‌های RAG فارسی، از مرحله بازیابی اطلاعات تا تولید پاسخ نهایی، ارائه می‌کنند.

🧠 بنچمارک مدل‌های تعبیه‌سازی (Embedding)

این بنچمارک کیفیت مدل‌های تعبیه‌سازی را در نمایش معنایی متون فارسی و بازیابی اسناد مرتبط ارزیابی می‌کند. مدل‌ها بر روی مجموعه‌داده‌های چندحوزه‌ای چراغ آزموده شده و عملکرد آن‌ها با معیارهایی مانند MRR و Recall@5 گزارش می‌شود.

وضعیت: ✅ منتشر شده

مشاهده بنچمارک:
https://huggingface.co/spaces/QomSSLab/cheRAGh-Embedding

🔍 بنچمارک مدل‌های بازرتبه‌بندی (Reranker)

پس از بازیابی اولیه، مدل‌های بازرتبه‌بندی وظیفه دارند اسناد بازیابی‌شده را بر اساس میزان ارتباط با پرسش مجدداً مرتب کنند. این بنچمارک توانایی مدل‌های Reranker را در بهبود کیفیت نتایج بازیابی و افزایش دقت سامانه‌های RAG ارزیابی می‌کند.

وضعیت: 🚧 در حال توسعه

🛠 بنچمارک فراخوانی ابزار (Tool Calling)

در بسیاری از سامانه‌های RAG، مدل زبانی باید بتواند ابزارهای مناسب را برای پاسخ‌گویی انتخاب و فراخوانی کند. این بنچمارک توانایی مدل‌ها را در انتخاب ابزار صحیح، تولید فراخوان معتبر، استفاده از خروجی ابزار و ادامه فرآیند استدلال و پاسخ‌گویی ارزیابی می‌کند.

وضعیت: 🚧 در حال توسعه

🤖 بنچمارک انتها به انتها سامانه‌های RAG

این بنچمارک عملکرد کامل سامانه‌های RAG را از دریافت پرسش تا تولید پاسخ نهایی ارزیابی می‌کند. در این بخش، تمامی اجزای سامانه شامل بازیابی، بازرتبه‌بندی، استفاده از ابزارها و تولید پاسخ به‌صورت یکپارچه سنجیده می‌شوند تا کیفیت نهایی سامانه در سناریوهای واقعی مشخص شود. این بنچمارک امکان مقایسه مستقیم سامانه‌های RAG مختلف را فراهم کرده و تصویری جامع از عملکرد آن‌ها در کاربردهای عملی ارائه می‌دهد.

وضعیت: 🚧 در حال توسعه

این چهار بنچمارک، مراحل اصلی یک سامانه RAG را پوشش می‌دهند و در کنار یکدیگر، بستری جامع برای ارزیابی و مقایسه مدل‌ها و سامانه‌های RAG فارسی فراهم می‌کنند. با توسعه پروژه چراغ، مجموعه‌داده‌های جدید، معیارهای ارزیابی، مدل‌های بیشتر و گزارش‌های تحلیلی به هر یک از این بنچمارک‌ها افزوده خواهد شد.

گالری
تصاویر