پژوهش علمی و فنی

ارتقای کیفیت بازنویسی کوئری جستجو با مدل‌های زبانی کوچک (SLM) و استدلال بازگشتی

توسعه یک معماری نوین در تقاطع بازیابی اطلاعات و بهینه‌سازی مدل‌های زبانی، جهت درک و تولید بهتر کوئری‌ها از طریق چرخه‌های محاسباتی متوالی

SLM

ضرورت و انگیزه پژوهش

در سامانه‌های جستجو و بازیابی اطلاعات، کاربر اغلب نیاز خود را در قالب عباراتی کوتاه، مبهم یا دارای ساختار غیردقیق بیان می‌کند. مسئله بازنویسی کوئری (Query Rewriting) یکی از ارکان حیاتی در موتورهای جستجوی مدرن است که وظیفه دارد نیت واقعی کاربر را درک کرده و کوئری خام را به عبارتی غنی‌تر، دقیق‌تر و سازگارتر با ساختار نمایه‌سازی سیستم تبدیل کند.

با ظهور مدل‌های زبانی، رویکرد بازنویسی کوئری از روش‌های مبتنی بر قواعد آماری به سمت روش‌های تولیدی و معنایی تغییر یافته است. با این حال، استفاده از مدل‌های زبانی بسیار بزرگ (LLMs) در سامانه‌های جستجوی بلادرنگ با محدودیت‌های جدی در زمینه تأخیر پاسخگویی (Latency) و هزینه‌های محاسباتی روبرو است. از سوی دیگر، مدل‌های زبانی کوچک (SLMs) گرچه از نظر سرعت و هزینه بهینه هستند، اما در درک ظرایف معنایی و استنتاج‌های چندمرحله‌ای برای بازنویسی‌های پیچیده دچار ضعف می‌باشند.

مسئله پژوهش و شکاف موجود

شکاف اصلی در این حوزه، یافتن نقطه تعادل میان «کارایی پردازشی» و «قدرت استدلال معنایی» است. مدل‌های کم‌پارامتر (SLMs) توانایی اجرای سریع را دارند، اما نمی‌توانند مانند مدل‌های بزرگتر، استدلال‌های عمیقی روی نیت کاربر انجام دهند.

پرسش کلیدی پژوهش

آیا مکانیزم‌های استدلال بازگشتی (Recurrent Reasoning) که پیش‌تر در حل مسائل ساختاریافته موفق بوده‌اند، می‌توانند در وظایف تولید متن به مدل‌های زبانی کوچک کمک کنند تا کیفیت بازنویسی کوئری را بدون افزایش چشمگیر پارامترها ارتقا دهند؟

این پژوهش به دنبال آن است که نشان دهد آیا می‌توان به جای افزایش ابعاد شبکه عصبی، با ایجاد چرخه‌های محاسباتی تکرارپذیر، عمق استدلال مدل را افزایش داد و خروجی‌هایی قابل رقابت با مدل‌های بزرگتر تولید کرد.

معماری و رویکرد پیشنهادی

در این پژوهش، یک معماری ترکیبی مبتنی بر تلفیق یک مدل زبانی کوچک (SLM) با یک ماژول استدلالی بازگشتی و کم‌پارامتر (مشابه معماری TRM) پیشنهاد شده است. هدف این ماژول این است که فرآیند بازنویسی را از یک عملیات تک‌مرحله‌ای به یک فرآیند تصفیه تدریجی تبدیل کند.

مراحل پیاده‌سازی و اجرای معماری:

گام اول: انتخاب مدل پایه
انتخاب یک مدل زبانی کوچک (SLM) و سبک‌وزن به عنوان هسته اصلی پردازش زبان طبیعی.
گام دوم: ادغام ماژول بازگشتی
افزودن ماژول استدلال بازگشتی به معماری مدل، که اجازه می‌دهد اطلاعات در چندین لایه و چرخه متوالی بازبینی شوند.
گام سوم: چرخه‌های تصفیه کوئری
مدل به جای تولید آنی پاسخ، کوئری اولیه را در طی چند چرخه محاسباتی متوالی پردازش کرده و ابهامات آن را تدریجاً برطرف می‌کند.
گام چهارم: بهینه‌سازی (Fine-Tuning)
آموزش و تنظیم ظریف معماری جدید با استفاده از دیتاست‌های استاندارد شامل زوج‌های «سؤال–کوئری» برای تطبیق با وظیفه جستجو.

فرآیند ارزیابی و دستاوردهای مورد انتظار

برای ارزیابی این معماری، خروجی‌های مدل در سیستم‌های بازیابی اطلاعات مورد بررسی قرار می‌گیرد. انتظار می‌رود این معماری بتواند با حفظ مزیت سبک‌وزنی، توانایی استدلال معنایی مدل را افزایش دهد.

نوع مدل زبانیهزینه محاسباتی / سرعتقدرت استدلال (مورد انتظار)پیچیدگی استقرار
مدل‌های غول‌پیکر (LLM)بسیار بالا / کندبسیار بالانیازمند سخت‌افزار پیشرفته
مدل‌های کوچک سنتی (Base SLM)بسیار پایین / بلادرنگمحدود و سطحیآسان و کم‌هزینه
مدل پیشنهادی (SLM + Recurrent)پایین / سریععمیق و تدریجیآسان و سازگار با سیستم‌های فعلی

این رویکرد نشان می‌دهد که با بازطراحی هوشمندانه مسیر جریان اطلاعات در شبکه عصبی، می‌توانیم کیفیت تولید متن در مدل‌های کوچک را به طور قابل‌توجهی ارتقا دهیم.

اهمیت و ابعاد کلیدی پژوهش

این تحقیق در تقاطع دو حوزه مهم از علوم کامپیوتر قرار دارد و دستاوردهای آن را می‌توان در سه بعد اصلی بررسی کرد:

01

بازیابی اطلاعات (IR)

ارائه راهکاری عملی برای درک بهتر نیت کاربر و بهبود چشمگیر کیفیت نتایج جستجو با اصلاح و گسترش معنایی کوئری‌های خام.

02

بهینه‌سازی معماری مدل‌ها

اثبات این موضوع که افزایش توانمندی هوش مصنوعی لزوماً در گرو افزایش تصاعدی پارامترها نیست و الگوهای استدلال بازگشتی راه‌گشا خواهند بود.

03

تولید متن و پردازش زبان

فراهم کردن دیدگاهی جدید برای استفاده از استدلال تدریجی در وظایف تولید متن، که می‌تواند فراتر از کوئری‌ها در سایر حوزه‌های NLP نیز کاربرد یابد.

جمع‌بندی

این پژوهش با معرفی یک چارچوب نوآورانه، تلاش دارد تا مرزهای کارایی مدل‌های زبانی کوچک را در وظایف مبتنی بر درک و تولید جابجا کند. با ادغام یک ماژول استدلال بازگشتی و کم‌پارامتر با یک مدل زبانی کوچک (SLM)، فرآیند بازنویسی کوئری به یک روند تصفیه گام‌به‌گام و هوشمند تبدیل می‌شود. نتایج این تحقیق نه‌تنها راهکاری اقتصادی و سریع برای بهبود موتورهای جستجو ارائه می‌دهد، بلکه افق‌های جدیدی را در زمینه توانمندسازی مدل‌های کم‌پارامتر از طریق الگوهای ساختاریافته استدلالی پیش روی پژوهشگران می‌گشاید.

Avatar photo
ریحانه نعمت اللهی

نظرات بسته شده است.