ارتقای کیفیت بازنویسی کوئری جستجو با مدلهای زبانی کوچک (SLM) و استدلال بازگشتی
توسعه یک معماری نوین در تقاطع بازیابی اطلاعات و بهینهسازی مدلهای زبانی، جهت درک و تولید بهتر کوئریها از طریق چرخههای محاسباتی متوالی

ضرورت و انگیزه پژوهش
در سامانههای جستجو و بازیابی اطلاعات، کاربر اغلب نیاز خود را در قالب عباراتی کوتاه، مبهم یا دارای ساختار غیردقیق بیان میکند. مسئله بازنویسی کوئری (Query Rewriting) یکی از ارکان حیاتی در موتورهای جستجوی مدرن است که وظیفه دارد نیت واقعی کاربر را درک کرده و کوئری خام را به عبارتی غنیتر، دقیقتر و سازگارتر با ساختار نمایهسازی سیستم تبدیل کند.
با ظهور مدلهای زبانی، رویکرد بازنویسی کوئری از روشهای مبتنی بر قواعد آماری به سمت روشهای تولیدی و معنایی تغییر یافته است. با این حال، استفاده از مدلهای زبانی بسیار بزرگ (LLMs) در سامانههای جستجوی بلادرنگ با محدودیتهای جدی در زمینه تأخیر پاسخگویی (Latency) و هزینههای محاسباتی روبرو است. از سوی دیگر، مدلهای زبانی کوچک (SLMs) گرچه از نظر سرعت و هزینه بهینه هستند، اما در درک ظرایف معنایی و استنتاجهای چندمرحلهای برای بازنویسیهای پیچیده دچار ضعف میباشند.
مسئله پژوهش و شکاف موجود
شکاف اصلی در این حوزه، یافتن نقطه تعادل میان «کارایی پردازشی» و «قدرت استدلال معنایی» است. مدلهای کمپارامتر (SLMs) توانایی اجرای سریع را دارند، اما نمیتوانند مانند مدلهای بزرگتر، استدلالهای عمیقی روی نیت کاربر انجام دهند.
آیا مکانیزمهای استدلال بازگشتی (Recurrent Reasoning) که پیشتر در حل مسائل ساختاریافته موفق بودهاند، میتوانند در وظایف تولید متن به مدلهای زبانی کوچک کمک کنند تا کیفیت بازنویسی کوئری را بدون افزایش چشمگیر پارامترها ارتقا دهند؟
این پژوهش به دنبال آن است که نشان دهد آیا میتوان به جای افزایش ابعاد شبکه عصبی، با ایجاد چرخههای محاسباتی تکرارپذیر، عمق استدلال مدل را افزایش داد و خروجیهایی قابل رقابت با مدلهای بزرگتر تولید کرد.
معماری و رویکرد پیشنهادی
در این پژوهش، یک معماری ترکیبی مبتنی بر تلفیق یک مدل زبانی کوچک (SLM) با یک ماژول استدلالی بازگشتی و کمپارامتر (مشابه معماری TRM) پیشنهاد شده است. هدف این ماژول این است که فرآیند بازنویسی را از یک عملیات تکمرحلهای به یک فرآیند تصفیه تدریجی تبدیل کند.
مراحل پیادهسازی و اجرای معماری:
فرآیند ارزیابی و دستاوردهای مورد انتظار
برای ارزیابی این معماری، خروجیهای مدل در سیستمهای بازیابی اطلاعات مورد بررسی قرار میگیرد. انتظار میرود این معماری بتواند با حفظ مزیت سبکوزنی، توانایی استدلال معنایی مدل را افزایش دهد.
| نوع مدل زبانی | هزینه محاسباتی / سرعت | قدرت استدلال (مورد انتظار) | پیچیدگی استقرار |
|---|---|---|---|
| مدلهای غولپیکر (LLM) | بسیار بالا / کند | بسیار بالا | نیازمند سختافزار پیشرفته |
| مدلهای کوچک سنتی (Base SLM) | بسیار پایین / بلادرنگ | محدود و سطحی | آسان و کمهزینه |
| مدل پیشنهادی (SLM + Recurrent) | پایین / سریع | عمیق و تدریجی | آسان و سازگار با سیستمهای فعلی |
این رویکرد نشان میدهد که با بازطراحی هوشمندانه مسیر جریان اطلاعات در شبکه عصبی، میتوانیم کیفیت تولید متن در مدلهای کوچک را به طور قابلتوجهی ارتقا دهیم.
اهمیت و ابعاد کلیدی پژوهش
این تحقیق در تقاطع دو حوزه مهم از علوم کامپیوتر قرار دارد و دستاوردهای آن را میتوان در سه بعد اصلی بررسی کرد:
بازیابی اطلاعات (IR)
ارائه راهکاری عملی برای درک بهتر نیت کاربر و بهبود چشمگیر کیفیت نتایج جستجو با اصلاح و گسترش معنایی کوئریهای خام.
بهینهسازی معماری مدلها
اثبات این موضوع که افزایش توانمندی هوش مصنوعی لزوماً در گرو افزایش تصاعدی پارامترها نیست و الگوهای استدلال بازگشتی راهگشا خواهند بود.
تولید متن و پردازش زبان
فراهم کردن دیدگاهی جدید برای استفاده از استدلال تدریجی در وظایف تولید متن، که میتواند فراتر از کوئریها در سایر حوزههای NLP نیز کاربرد یابد.
جمعبندی
این پژوهش با معرفی یک چارچوب نوآورانه، تلاش دارد تا مرزهای کارایی مدلهای زبانی کوچک را در وظایف مبتنی بر درک و تولید جابجا کند. با ادغام یک ماژول استدلال بازگشتی و کمپارامتر با یک مدل زبانی کوچک (SLM)، فرآیند بازنویسی کوئری به یک روند تصفیه گامبهگام و هوشمند تبدیل میشود. نتایج این تحقیق نهتنها راهکاری اقتصادی و سریع برای بهبود موتورهای جستجو ارائه میدهد، بلکه افقهای جدیدی را در زمینه توانمندسازی مدلهای کمپارامتر از طریق الگوهای ساختاریافته استدلالی پیش روی پژوهشگران میگشاید.