تبدیل گفتار به متن (STT / ASR)
در دنیای امروز
از HMM تا مدلهای هیبریدی SALM؛ مروری جامع بر معماریها، مدلهای برتر ۲۰۲۵–۲۰۲۶، چالشهای فارسی، و مسیر آینده این فناوری
STT چیست و چرا اهمیت دارد؟
Speech-to-Text یا ASR (Automatic Speech Recognition) فناوریای است که صدای گفتاری انسان را به متن نوشتاری تبدیل میکند. این که به نظر ساده میرسد، فریبنده است — پشت هر کلمهای که رونویسی میشود، دههها تحقیق در پردازش سیگنال، زبانشناسی، و یادگیری عمیق نهفته است.
بازار جهانی این فناوری در مسیر رشد بیسابقهای قرار دارد و تا سال ۲۰۳۰ به ۵۳ میلیارد دلار خواهد رسید. محرک اصلی این رشد، انقلاب مدلهای زبانی بزرگ و ظهور معماریهای ترکیبی LALM (Large Audio-Language Model) است که دیگر صرفاً رونویسی نمیکنند — بلکه «میفهمند».
تا ۲۰۲۲ مدلهای ASR «الگو میشناختند». از ۲۰۲۳ به بعد مدلهای LALM جدید «میفهمند» — صدا را درک میکنند، نه فقط رونویسی میکنند. این تفاوت ذاتی در معماری، نه صرفاً دقت بیشتر، است.
سیر تکامل معماریهای STT
برای فهمیدن اینکه مدلهای امروز کجا هستند، باید بدانیم از کجا آمدهایم:
مدلهای مارکوف مخفی با مخلوط گاوسی. سیستم به سه بخش مستقل نیاز داشت: مدل آکوستیک، مدل تلفظ، و مدل زبانی. دقت پایین، نیاز به متخصص، و شکنندگی در برابر نویز مشکل اصلی بودند.
GMM · HMM · N-gram LMجایگزینی GMM با DNN جهشی بزرگ بود. بعدها RNN و LSTM برای مدلسازی توالیهای زمانی وارد شدند. این معماریها هنوز به pipeline چندمرحلهای نیاز داشتند.
DNN · LSTM · RNN · CTCConformer (ترکیب Transformer + Convolution) همه چیز را تغییر داد. مدلهای End-to-End مثل wav2vec 2.0 و Whisper مستقیماً از موج صوتی به متن میرفتند. آموزش روی صدها هزار ساعت داده و عملکرد بیسابقه.
Transformer · Conformer · wav2vec · Whisperمعماری هیبریدی SALM (Speech-Augmented Language Model). یک encoder صوتی قوی (مثل FastConformer) مستقیماً به یک LLM وصل میشود. مدلها فقط رونویسی نمیکنند — خلاصه میدهند، سوال پاسخ میدهند. NVIDIA Canary-Qwen اولین نمونه open-source بود.
FastConformer · SALM · Multimodal ASRنسل کاملاً جدید: Large Audio-Language Model. مدلهایی مثل Qwen3-ASR از Qwen3-Omni به عنوان foundation استفاده میکنند و با Reinforcement Learning fine-tune شدهاند. نتیجه: مقاومت استثنایی در برابر نویز، آواز، لهجه، و patternهای پیچیده متنی. Voxtral از Mistral نیز همین مسیر را با معماری 4B streaming دنبال میکند.
LALM · Qwen3-Omni · AuT · GSPO-RL · Streaming 4Bمدلهای برتر ۲۰۲۵ — پایههای نسل جدید
این مدلها در ۲۰۲۵ معیار صنعت شدند و هنوز در بسیاری از use caseها انتخاب درست هستند:
اولین SALM open-source. FastConformer encoder + Qwen3-1.7B decoder. قادر به رونویسی، خلاصه، و پاسخ به سوال. تا اواخر ۲۰۲۵ صدرنشین Open ASR Leaderboard بود — اکنون Qwen3-ASR جایش را گرفته.
بهترین throughput در بین همه مدلهای موجود. روی ۳۶,۰۰۰ ساعت صدا (شامل سکوت و نویز) آموزش دیده. برای real-time captioning و کالسنتر. Parakeet V3 (2026) با پشتیبانی ۲۵ زبان منتشر شده.
Ergodic Streaming Encoder برای latency بسیار پایین. Window داینامیک بهجای chunk ثابت ۳۰ ثانیه Whisper. مصرف برق کمتر، ایدهآل برای موبایل و IoT. تیم ۶ نفره رقیب NVIDIA و OpenAI شد.
اکوسیستم وسیع، مستندات فراوان، آسانترین راهاندازی. همچنان بهترین انتخاب برای پروژههای multilingual عمومی. OpenAI در مارس ۲۰۲۵ مدلهای GPT-4o-Transcribe و GPT-4o-mini-Transcribe را هم منتشر کرد.
مدلهای جدید ۲۰۲۶ تازه
از اواخر ۲۰۲۵ تا ابتدای ۲۰۲۶ موج جدیدی از مدلها آمد که رقابت را کاملاً عوض کرد. اینها مدلهایی هستند که الان باید بشناسید:
صدرنشین فعلی Open ASR Leaderboard در بین مدلهای open-source. بر پایه Qwen3-Omni آموزش دیده و با Reinforcement Learning (GSPO) fine-tune شده. ویژگی منحصربهفرد: میتواند آواز و موسیقی را هم رونویسی کند. نسخه 0.6B برای edge deployment، TTFT میانگین ۹۲ms. همراه با Qwen3-ForcedAligner-0.6B برای timestamp دقیق.
مدل 4B streaming از Mistral. دو نسخه: Mini Transcribe V2 (batch) و Realtime (streaming). پشتیبانی از diarization، context biasing، و word-level timestamps. ادعا میکند از GPT-4o mini Transcribe، Gemini 2.5 Flash، و Deepgram Nova بهتر است — با قیمت تقریباً یکپنجم ElevenLabs Scribe.
اولین مدلی که همزمان در AA-WER و latency پیشرو شد. 2.3% WER روی benchmarkهای مستقل — پایینترین عدد موجود. برای voice agent enterprise انتخاب اول است اما گرانترین گزینه نیز هست.
صدرنشین کل Hugging Face Open ASR Leaderboard (شامل commercial). بر Universal-2 که از اوت ۲۰۲۵ با 99 زبان و sentiment/entity/diarization built-in عرضه شده بود ساخته شده. Voice Agent API یکپارچه با STT+LLM+TTS روی یک WebSocket.
مدل اختصاصی STT مایکروسافت. 3.0% AA-WER با پوشش ۱۴۰+ زبان — بهترین انتخاب برای enterpriseهای embedded در Azure. رقیب مستقیم Google Chirp 3 که همزمان در public preview است.
ارزانترین گزینه با کیفیت بالا در بازار. برای batch transcription حجم بالا که بودجه محدود دارد. اگر فقط به زبانهای پشتیبانیشده نیاز دارید و real-time نمیخواهید، بهترین ROI را دارد.
رقابت در ۲۰۲۶ دیگر فقط روی WER نیست. Deepgram Nova-3 با latency زیر ۳۰۰ms و Qwen3-ASR با تسلط روی چند زبان و لهجه همزمان، نشان میدهند که «بهترین مدل» کاملاً به use case شما بستگی دارد.
جدول مقایسه کمّی مدلها (۲۰۲۵–۲۰۲۶)
اعداد زیر بر اساس Hugging Face Open ASR Leaderboard، AA-WER v2.0 (Artificial Analysis)، و technical reportهای رسمی تا خرداد ۱۴۰۵ هستند:
| مدل | WER / AA-WER | RTFx / Latency | زبان | Streaming | نوع |
|---|---|---|---|---|---|
| ElevenLabs Scribe v2 ۲۰۲۶ | ~150ms | چندزبانه | بله | Commercial | |
| Voxtral Small ۲۰۲۶ | <200ms | 13 زبان | بله | Open-weight | |
| Azure MAI-Transcribe-1 ۲۰۲۶ | ~140ms | 140+ | بله | Commercial | |
| AssemblyAI Universal-3 Pro ۲۰۲۶ | ~150ms | 99+ | بله | Commercial | |
| Qwen3-ASR-1.7B ۲۰۲۶ | 92ms (0.6B) | 52 زبان | بله | Open (Apache 2) | |
| Canary-Qwen 2.5B | ×418 | انگلیسی محور | محدود | Open (Apache 2) | |
| Parakeet TDT 1.1B | >2000x | انگلیسی | بله | Open (Apache 2) | |
| Whisper Large V3 Turbo | ×6 vs V3 | 99+ | جزئی | Open (MIT) | |
| Moonshine v2 | بسیار پایین | انگلیسی | بله | Open (MIT) |
AA-WER v2.0 و WER معمولی یکی نیستند. AA-WER روی دادههای متنوعتر (VoxPopuli، Earnings-22، AMI-SDM، AgentTalk) سنجیده میشود و معمولاً بالاتر از WER رسمی مدل است. همیشه روی داده خودتان benchmark بگیرید.
چرا STT فارسی یک مسئله منحصربهفرد است؟
فارسی از نظر پردازش گفتار یکی از چالشبرانگیزترین زبانهاست. مشکل فقط کمبود داده نیست — ساختار زبانی فارسی ذاتاً پیچیدهتر است:
الفبای فارسی راستبهچپ است و حروف در موقعیتهای مختلف شکل متفاوت میگیرند. موتورهای STT باید این را در نرمالیزاسیون متن لحاظ کنند.
از تهرانی تا اصفهانی، شیرازی، مشهدی — هر لهجه تلفظهای متفاوتی دارد. فارسی افغانستان (دری) و تاجیکی هم چالشهای اضافه ایجاد میکنند.
فارسی کلمات مرکب فراوانی دارد که گاهی چسبیده و گاهی جدا نوشته میشوند: «امیررضا» یا «امیر رضا» — مشکل کلاسیک segmentation.
فارسی هم با اعداد فارسی و هم عربی نوشته میشود. اصطلاحات عربی فراوانی در متن وجود دارد که تلفظ و نگارش متفاوتی دارند.
Common Voice فارسی نسبت به انگلیسی صدها برابر کوچکتر است. بسیاری از دیتاستهای موجود نویز بالایی دارند — WER گوگل روی Common Voice فارسی ۲۵.۲٪ گزارش شده.
اکثر کاربردهای تجاری STT فارسی با صوت ۸kHz تلفنی سروکار دارند که noise reduction اضافه میکند و خطای مدلهای عمومی را بالا میبرد.
WER گوگل STT روی Common Voice فارسی 25.2% است، Whisper این عدد را به 31.75% میرساند. این ارقام نشان میدهد مدلهای عمومی برای فارسی به fine-tuning اختصاصی نیاز قطعی دارند.
وضعیت مدلهای STT برای فارسی
اکوسیستم STT فارسی در حال رشد است. مدلها و رویکردهای اصلی موجود:
| مدل / رویکرد | نوع | وضعیت | نکته مهم |
|---|---|---|---|
| Qwen3-ASR + فارسی ۲۰۲۶ | Open-source + سفارشی | در حال بررسی | از ۵۲ زبان پشتیبانی میکند — نیاز به تست جدی روی فارسی محاورهای دارد. معماری LALM آن برای لهجه و نویز امیدوارکننده است |
| Whisper + Fine-tuning فارسی | Open-source + سفارشی | رایجترین رویکرد | Fine-tune روی Common Voice فارسی و دیتاستهای اختصاصی. بهترین balance بین دقت و سرعت اجرا برای اکثر use caseها |
| Google STT (Chirp 3) ۲۰۲۶ | Commercial API | Public Preview | جدیدترین نسخه Chirp با denoiser built-in و speaker diarization. پایینترین WER cloud برای فارسی اما محدودیت دسترسی در ایران همچنان وجود دارد |
| wav2vec 2.0 + فارسی | Open-source + سفارشی | فعال در پژوهش | self-supervised روی صوت فارسی بدون نیاز به transcription — جذاب برای دادههای unlabeled فراوان |
| Shenasa / HamTech ASR | ایرانی | محدود | دیتاست ۳۰ ساعته open-source. نقطه شروع خوب برای تحقیق، برای production کافی نیست |
| Conformer اختصاصی domain | تجاری/سفارشی | بهترین نتیجه | شرکتهایی که روی داده domain-specific (کالسنتر، پزشکی) مدل سفارشی ساختهاند بهترین عملکرد را دارند |
رویکرد عملی پیشنهادی برای فارسی
- پایه: Whisper Large V3 Turbo یا در صورت نیاز به چندزبانگی، Qwen3-ASR-1.7B را آزمایش کنید
- Fine-tuning: حداقل ۱۰۰ ساعت صوت labeled domain-specific برای نتایج قابل قبول
- نرمالیزاسیون: یک لایه post-processing قوی برای همگنسازی اعداد، اصطلاحات، و کلمات مرکب ضروری است
- Language Model: ادغام LM فارسی برای بهبود coherence خروجی — خصوصاً برای اسامی خاص و اصطلاحات تخصصی
- Forced Alignment: برای timestamp دقیق از Qwen3-ForcedAligner-0.6B استفاده کنید — از WhisperX بهتر است
STT فارسی با WER زیر ۱۰٪ روی صوت مکالمهای واقعی (نه benchmark) هنوز یک جای خالی واقعی در بازار است. تیمی که بهترین دیتاست domain-specific فارسی را بسازد — نه لزوماً بهترین مدل — برنده این بازار خواهد بود.
مسیر آینده — به کجا میرویم؟
Qwen3-ASR و Voxtral نشان دادند که foundation model قوی + RL برتر از معماری ASR اختصاصی است. در ۲۰۲۶–۲۰۲۷ هر بازیگر بزرگ یک LALM اختصاصی خواهد داشت. pipelineهای چندمرحلهای legacy دیگر توجیه ندارند.
Nova-3 در ۲۰۲۵ ثابت کرد میتوان ۱۰ زبان را همزمان و بدون routing پردازش کرد. برای فارسی این بسیار مهم است — گفتار روزمره فارسی پر از کلمات انگلیسی، عربی، و اصطلاحات فنی است که مدل باید آنها را درست رونویسی کند.
Moonshine v2 با 245M پارامتر به دقت Whisper Large رسید. Qwen3-ASR-0.6B TTFT 92ms دارد. مسیر روشن است: در ۲ سال آینده STT با کیفیت enterprise روی هر گوشی هوشمند — بدون cloud — اجرا خواهد شد.
نسل بعدی مدلها نهتنها متن بلکه احساسات، استرس، اطمینان گوینده، و حتی وضعیت سلامت را تخمین میزنند. Qwen3-ASR-Flash قبلاً توانایی رونویسی آواز با نویز پسزمینه را نشان داد — قدم بعدی تحلیل paralinguistic است.
AssemblyAI، Azure، و Google در حال ساختن رابطهایی هستند که شرکتها مدل STT را روی دیتاست خودشان fine-tune کنند بدون نیاز به تیم یادگیری ماشین. این یک differentiator بزرگ برای سرویسدهندههای B2B خواهد بود.
کاربردهای صنعتی STT
بالاترین دقت کل: ElevenLabs Scribe v2 · بهترین open-source چندزبانه: Qwen3-ASR-1.7B · سریعترین throughput: Parakeet TDT · ارزانترین batch: Voxtral Mini · On-device: Moonshine v2 یا Qwen3-ASR-0.6B · Enterprise Azure: MAI-Transcribe-1 · فارسی تخصصی: Whisper fine-tuned + LM فارسی
جمعبندی
از ژانویه تا خرداد ۱۴۰۵، بازار STT چهار تحول بزرگ داشت: Qwen3-ASR معماری LALM+RL را به open-source آورد، Voxtral نشان داد ۴B streaming میتواند رقیب مدلهای بزرگتر باشد، ElevenLabs Scribe v2 برای اولین بار WER و latency را همزمان بهینه کرد، و Microsoft با MAI-Transcribe-1 وارد رقابت مستقیم شد.
سه نکته کلیدی برای هر تیمی که در این حوزه کار میکند:
- معیار انتخاب را تغییر دهید: WER دیگر تنها معیار نیست. AA-WER روی دادههای متنوع، streaming latency، قابلیت fine-tuning، و هزینه inference همه در انتخاب نهایی اهمیت دارند.
- برای فارسی، داده مهمتر از مدل است: Qwen3-ASR از ۵۲ زبان پشتیبانی میکند اما هنوز نیاز به fine-tuning اختصاصی فارسی دارد. تیمی که بهترین دیتاست domain-specific فارسی را بسازد — نه لزوماً بهترین مدل — برنده خواهد بود.
- LALM آینده است — الان آماده شوید: pipelineهای چندمرحلهای legacy در حال منسوخ شدن هستند. سرمایهگذاری روی معماریهای یکپارچه ASR+LLM از همین حالا توجیه دارد.