مقاله فنی · به‌روز تا خرداد ۱۴۰۵ / ۲۰۲۶

تبدیل گفتار به متن (STT / ASR)
در دنیای امروز

از HMM تا مدل‌های هیبریدی SALM؛ مروری جامع بر معماری‌ها، مدل‌های برتر ۲۰۲۵–۲۰۲۶، چالش‌های فارسی، و مسیر آینده این فناوری

زمان مطالعه: ۱۵ دقیقه سطح: فنی + مدیریتی آخرین به‌روزرسانی: خرداد ۱۴۰۵

STT چیست و چرا اهمیت دارد؟

Speech-to-Text یا ASR (Automatic Speech Recognition) فناوری‌ای است که صدای گفتاری انسان را به متن نوشتاری تبدیل می‌کند. این که به نظر ساده می‌رسد، فریبنده است — پشت هر کلمه‌ای که رونویسی می‌شود، دهه‌ها تحقیق در پردازش سیگنال، زبان‌شناسی، و یادگیری عمیق نهفته است.

بازار جهانی این فناوری در مسیر رشد بی‌سابقه‌ای قرار دارد و تا سال ۲۰۳۰ به ۵۳ میلیارد دلار خواهد رسید. محرک اصلی این رشد، انقلاب مدل‌های زبانی بزرگ و ظهور معماری‌های ترکیبی LALM (Large Audio-Language Model) است که دیگر صرفاً رونویسی نمی‌کنند — بلکه «می‌فهمند».

تحول پارادایم

تا ۲۰۲۲ مدل‌های ASR «الگو می‌شناختند». از ۲۰۲۳ به بعد مدل‌های LALM جدید «می‌فهمند» — صدا را درک می‌کنند، نه فقط رونویسی می‌کنند. این تفاوت ذاتی در معماری، نه صرفاً دقت بیشتر، است.

سیر تکامل معماری‌های STT

برای فهمیدن اینکه مدل‌های امروز کجا هستند، باید بدانیم از کجا آمده‌ایم:

دهه ۱۹۸۰ – ۲۰۱۰
HMM + GMM — دوران کلاسیک

مدل‌های مارکوف مخفی با مخلوط گاوسی. سیستم به سه بخش مستقل نیاز داشت: مدل آکوستیک، مدل تلفظ، و مدل زبانی. دقت پایین، نیاز به متخصص، و شکنندگی در برابر نویز مشکل اصلی بودند.

GMM · HMM · N-gram LM
۲۰۱۲ – ۲۰۱۸
DNN-HMM — شبکه‌های عصبی وارد می‌شوند

جایگزینی GMM با DNN جهشی بزرگ بود. بعدها RNN و LSTM برای مدل‌سازی توالی‌های زمانی وارد شدند. این معماری‌ها هنوز به pipeline چندمرحله‌ای نیاز داشتند.

DNN · LSTM · RNN · CTC
۲۰۱۸ – ۲۰۲۲
End-to-End Transformers — انقلاب معماری

Conformer (ترکیب Transformer + Convolution) همه چیز را تغییر داد. مدل‌های End-to-End مثل wav2vec 2.0 و Whisper مستقیماً از موج صوتی به متن می‌رفتند. آموزش روی صدها هزار ساعت داده و عملکرد بی‌سابقه.

Transformer · Conformer · wav2vec · Whisper
۲۰۲۳ – ۲۰۲۵
SALM — ترکیب ASR با LLM

معماری هیبریدی SALM (Speech-Augmented Language Model). یک encoder صوتی قوی (مثل FastConformer) مستقیماً به یک LLM وصل می‌شود. مدل‌ها فقط رونویسی نمی‌کنند — خلاصه می‌دهند، سوال پاسخ می‌دهند. NVIDIA Canary-Qwen اولین نمونه open-source بود.

FastConformer · SALM · Multimodal ASR
۲۰۲۵ – اکنون (۲۰۲۶)
LALM + RL — فهمیدن صدا، نه فقط رونویسی

نسل کاملاً جدید: Large Audio-Language Model. مدل‌هایی مثل Qwen3-ASR از Qwen3-Omni به عنوان foundation استفاده می‌کنند و با Reinforcement Learning fine-tune شده‌اند. نتیجه: مقاومت استثنایی در برابر نویز، آواز، لهجه، و pattern‌های پیچیده متنی. Voxtral از Mistral نیز همین مسیر را با معماری 4B streaming دنبال می‌کند.

LALM · Qwen3-Omni · AuT · GSPO-RL · Streaming 4B

مدل‌های برتر ۲۰۲۵ — پایه‌های نسل جدید

این مدل‌ها در ۲۰۲۵ معیار صنعت شدند و هنوز در بسیاری از use caseها انتخاب درست هستند:

بالاترین دقت Open-Source
NVIDIA Canary-Qwen 2.5B
NVIDIA · June 2025
WER (avg)5.63%
RTFx×418
معماریSALM
پارامترها2.5B

اولین SALM open-source. FastConformer encoder + Qwen3-1.7B decoder. قادر به رونویسی، خلاصه، و پاسخ به سوال. تا اواخر ۲۰۲۵ صدرنشین Open ASR Leaderboard بود — اکنون Qwen3-ASR جایش را گرفته.

سریع‌ترین Throughput
NVIDIA Parakeet TDT 1.1B
NVIDIA · 2024–2025
RTFx>2000
Streamingبله
Hallucinationبسیار کم
لایسنسApache 2.0

بهترین throughput در بین همه مدل‌های موجود. روی ۳۶,۰۰۰ ساعت صدا (شامل سکوت و نویز) آموزش دیده. برای real-time captioning و کال‌سنتر. Parakeet V3 (2026) با پشتیبانی ۲۵ زبان منتشر شده.

بهترین Edge / On-Device
Moonshine v2
Useful Sensors · 2025
پارامترها245M
Streamingبله (ESE)
مقایسه با W-Large-v36× کوچکتر
لایسنسMIT

Ergodic Streaming Encoder برای latency بسیار پایین. Window داینامیک به‌جای chunk ثابت ۳۰ ثانیه Whisper. مصرف برق کمتر، ایده‌آل برای موبایل و IoT. تیم ۶ نفره رقیب NVIDIA و OpenAI شد.

استاندارد Multilingual
Whisper Large V3 Turbo
OpenAI · October 2024
زبان‌ها99+
WER avg~7.4%
Decoder Layers4 (از 32)
سرعت vs V36× سریع‌تر

اکوسیستم وسیع، مستندات فراوان، آسان‌ترین راه‌اندازی. همچنان بهترین انتخاب برای پروژه‌های multilingual عمومی. OpenAI در مارس ۲۰۲۵ مدل‌های GPT-4o-Transcribe و GPT-4o-mini-Transcribe را هم منتشر کرد.

مدل‌های جدید ۲۰۲۶ تازه

از اواخر ۲۰۲۵ تا ابتدای ۲۰۲۶ موج جدیدی از مدل‌ها آمد که رقابت را کاملاً عوض کرد. این‌ها مدل‌هایی هستند که الان باید بشناسید:

جدید · ژانویه ۲۰۲۶
Qwen3-ASR-1.7B SOTA
Alibaba / Qwen Team · Jan 29, 2026
زبان‌ها30 زبان + 22 لهجه چینی
وضعیتSOTA Open-Source
معماریLALM + AuT + GSPO-RL
لایسنسApache 2.0

صدرنشین فعلی Open ASR Leaderboard در بین مدل‌های open-source. بر پایه Qwen3-Omni آموزش دیده و با Reinforcement Learning (GSPO) fine-tune شده. ویژگی منحصربه‌فرد: می‌تواند آواز و موسیقی را هم رونویسی کند. نسخه 0.6B برای edge deployment، TTFT میانگین ۹۲ms. همراه با Qwen3-ForcedAligner-0.6B برای timestamp دقیق.

جدید · فوریه ۲۰۲۶
Voxtral (Mistral AI)
Mistral AI · Feb 2026
AA-WER v2.02.9% (Voxtral Small)
Streaming Latency<200ms
زبان‌ها13 زبان + Diarization
لایسنس RealtimeApache 2.0

مدل 4B streaming از Mistral. دو نسخه: Mini Transcribe V2 (batch) و Realtime (streaming). پشتیبانی از diarization، context biasing، و word-level timestamps. ادعا می‌کند از GPT-4o mini Transcribe، Gemini 2.5 Flash، و Deepgram Nova بهتر است — با قیمت تقریباً یک‌پنجم ElevenLabs Scribe.

جدید · ژانویه ۲۰۲۶
ElevenLabs Scribe v2
ElevenLabs · Jan 6, 2026
AA-WER v2.02.3% (کمترین)
Streaming Latency~150ms
ویژگیدقت + سرعت همزمان
نوعCommercial

اولین مدلی که همزمان در AA-WER و latency پیشرو شد. 2.3% WER روی benchmarkهای مستقل — پایین‌ترین عدد موجود. برای voice agent enterprise انتخاب اول است اما گران‌ترین گزینه نیز هست.

جدید · ۲۰۲۶
AssemblyAI Universal-3 Pro
AssemblyAI · 2026
WER (English)6.3%
Latency P50~150ms
ویژگیEntity + Sentiment
Leaderboard#1 کل (commercial)

صدرنشین کل Hugging Face Open ASR Leaderboard (شامل commercial). بر Universal-2 که از اوت ۲۰۲۵ با 99 زبان و sentiment/entity/diarization built-in عرضه شده بود ساخته شده. Voice Agent API یکپارچه با STT+LLM+TTS روی یک WebSocket.

جدید · ۲۰۲۶
Azure MAI-Transcribe-1
Microsoft · 2026
AA-WER v2.03.0%
زبان‌ها140+
Latency~140ms
یکپارچگیAzure Ecosystem

مدل اختصاصی STT مایکروسافت. 3.0% AA-WER با پوشش ۱۴۰+ زبان — بهترین انتخاب برای enterprise‌های embedded در Azure. رقیب مستقیم Google Chirp 3 که همزمان در public preview است.

ارزان‌ترین · ۲۰۲۶
Mistral Voxtral Mini
Mistral AI · Feb 2026
AA-WER v2.03.7%
قیمت$1 / 1000 دقیقه
زبان‌ها8 زبان
نوعBatch Transcribe

ارزان‌ترین گزینه با کیفیت بالا در بازار. برای batch transcription حجم بالا که بودجه محدود دارد. اگر فقط به زبان‌های پشتیبانی‌شده نیاز دارید و real-time نمی‌خواهید، بهترین ROI را دارد.

نکته مهم ۲۰۲۶

رقابت در ۲۰۲۶ دیگر فقط روی WER نیست. Deepgram Nova-3 با latency زیر ۳۰۰ms و Qwen3-ASR با تسلط روی چند زبان و لهجه همزمان، نشان می‌دهند که «بهترین مدل» کاملاً به use case شما بستگی دارد.

جدول مقایسه کمّی مدل‌ها (۲۰۲۵–۲۰۲۶)

اعداد زیر بر اساس Hugging Face Open ASR Leaderboard، AA-WER v2.0 (Artificial Analysis)، و technical reportهای رسمی تا خرداد ۱۴۰۵ هستند:

مدلWER / AA-WERRTFx / LatencyزبانStreamingنوع
ElevenLabs Scribe v2 ۲۰۲۶
2.3%
~150msچندزبانهبلهCommercial
Voxtral Small ۲۰۲۶
2.9%
<200ms13 زبانبلهOpen-weight
Azure MAI-Transcribe-1 ۲۰۲۶
3.0%
~140ms140+بلهCommercial
AssemblyAI Universal-3 Pro ۲۰۲۶
6.3% (EN)
~150ms99+بلهCommercial
Qwen3-ASR-1.7B ۲۰۲۶
SOTA open-src
92ms (0.6B)52 زبانبلهOpen (Apache 2)
Canary-Qwen 2.5B
5.63%
×418انگلیسی محورمحدودOpen (Apache 2)
Parakeet TDT 1.1B
~7.2%
>2000xانگلیسیبلهOpen (Apache 2)
Whisper Large V3 Turbo
~7.4%
×6 vs V399+جزئیOpen (MIT)
Moonshine v2
مشابه W-Large
بسیار پایینانگلیسیبلهOpen (MIT)
هشدار مقایسه

AA-WER v2.0 و WER معمولی یکی نیستند. AA-WER روی داده‌های متنوع‌تر (VoxPopuli، Earnings-22، AMI-SDM، AgentTalk) سنجیده می‌شود و معمولاً بالاتر از WER رسمی مدل است. همیشه روی داده خودتان benchmark بگیرید.

چرا STT فارسی یک مسئله منحصربه‌فرد است؟

فارسی از نظر پردازش گفتار یکی از چالش‌برانگیزترین زبان‌هاست. مشکل فقط کمبود داده نیست — ساختار زبانی فارسی ذاتاً پیچیده‌تر است:

📝
خط راست‌به‌چپ + نقطه‌گذاری پیچیده

الفبای فارسی راست‌به‌چپ است و حروف در موقعیت‌های مختلف شکل متفاوت می‌گیرند. موتورهای STT باید این را در نرمالیزاسیون متن لحاظ کنند.

🗣️
تنوع لهجه‌ای بالا

از تهرانی تا اصفهانی، شیرازی، مشهدی — هر لهجه تلفظ‌های متفاوتی دارد. فارسی افغانستان (دری) و تاجیکی هم چالش‌های اضافه ایجاد می‌کنند.

🔤
همگن‌سازی کلمات مرکب

فارسی کلمات مرکب فراوانی دارد که گاهی چسبیده و گاهی جدا نوشته می‌شوند: «امیررضا» یا «امیر رضا» — مشکل کلاسیک segmentation.

🔢
اعداد و اصطلاحات عربی

فارسی هم با اعداد فارسی و هم عربی نوشته می‌شود. اصطلاحات عربی فراوانی در متن وجود دارد که تلفظ و نگارش متفاوتی دارند.

💾
کمبود داده آموزشی

Common Voice فارسی نسبت به انگلیسی صدها برابر کوچکتر است. بسیاری از دیتاست‌های موجود نویز بالایی دارند — WER گوگل روی Common Voice فارسی ۲۵.۲٪ گزارش شده.

📞
کیفیت پایین صوت تلفنی

اکثر کاربردهای تجاری STT فارسی با صوت ۸kHz تلفنی سروکار دارند که noise reduction اضافه می‌کند و خطای مدل‌های عمومی را بالا می‌برد.

داده واقعی

WER گوگل STT روی Common Voice فارسی 25.2% است، Whisper این عدد را به 31.75% می‌رساند. این ارقام نشان می‌دهد مدل‌های عمومی برای فارسی به fine-tuning اختصاصی نیاز قطعی دارند.

وضعیت مدل‌های STT برای فارسی

اکوسیستم STT فارسی در حال رشد است. مدل‌ها و رویکردهای اصلی موجود:

مدل / رویکردنوعوضعیتنکته مهم
Qwen3-ASR + فارسی ۲۰۲۶Open-source + سفارشیدر حال بررسیاز ۵۲ زبان پشتیبانی می‌کند — نیاز به تست جدی روی فارسی محاوره‌ای دارد. معماری LALM آن برای لهجه و نویز امیدوارکننده است
Whisper + Fine-tuning فارسیOpen-source + سفارشیرایج‌ترین رویکردFine-tune روی Common Voice فارسی و دیتاست‌های اختصاصی. بهترین balance بین دقت و سرعت اجرا برای اکثر use caseها
Google STT (Chirp 3) ۲۰۲۶Commercial APIPublic Previewجدیدترین نسخه Chirp با denoiser built-in و speaker diarization. پایین‌ترین WER cloud برای فارسی اما محدودیت دسترسی در ایران همچنان وجود دارد
wav2vec 2.0 + فارسیOpen-source + سفارشیفعال در پژوهشself-supervised روی صوت فارسی بدون نیاز به transcription — جذاب برای داده‌های unlabeled فراوان
Shenasa / HamTech ASRایرانیمحدوددیتاست ۳۰ ساعته open-source. نقطه شروع خوب برای تحقیق، برای production کافی نیست
Conformer اختصاصی domainتجاری/سفارشیبهترین نتیجهشرکت‌هایی که روی داده domain-specific (کال‌سنتر، پزشکی) مدل سفارشی ساخته‌اند بهترین عملکرد را دارند

رویکرد عملی پیشنهادی برای فارسی

  • پایه: Whisper Large V3 Turbo یا در صورت نیاز به چندزبانگی، Qwen3-ASR-1.7B را آزمایش کنید
  • Fine-tuning: حداقل ۱۰۰ ساعت صوت labeled domain-specific برای نتایج قابل قبول
  • نرمالیزاسیون: یک لایه post-processing قوی برای همگن‌سازی اعداد، اصطلاحات، و کلمات مرکب ضروری است
  • Language Model: ادغام LM فارسی برای بهبود coherence خروجی — خصوصاً برای اسامی خاص و اصطلاحات تخصصی
  • Forced Alignment: برای timestamp دقیق از Qwen3-ForcedAligner-0.6B استفاده کنید — از WhisperX بهتر است
فرصت بازار

STT فارسی با WER زیر ۱۰٪ روی صوت مکالمه‌ای واقعی (نه benchmark) هنوز یک جای خالی واقعی در بازار است. تیمی که بهترین دیتاست domain-specific فارسی را بسازد — نه لزوماً بهترین مدل — برنده این بازار خواهد بود.

کاربردهای صنعتی STT

📞
کال‌سنتر
رونویسی مکالمات، تحلیل کیفیت، تشخیص احساسات مشتری
🏥
پزشکی
دیکته پزشکی، مستندسازی ویزیت، پرونده بالینی خودکار
📺
رسانه
زیرنویس خودکار، ایندکس‌گذاری آرشیو صوتی، ترجمه real-time
🎓
آموزش
رونویسی کلاس آنلاین، accessibility برای ناشنوایان، جستجو در محتوا
⚖️
حقوقی
مستندسازی جلسات دادگاه، رونویسی مصاحبه‌ها، آرشیو مذاکرات
🏦
مالی
Compliance recording، رونویسی جلسات هیئت‌مدیره، تحلیل sentiment
راهنمای انتخاب سریع ۲۰۲۶

بالاترین دقت کل: ElevenLabs Scribe v2 · بهترین open-source چندزبانه: Qwen3-ASR-1.7B · سریع‌ترین throughput: Parakeet TDT · ارزان‌ترین batch: Voxtral Mini · On-device: Moonshine v2 یا Qwen3-ASR-0.6B · Enterprise Azure: MAI-Transcribe-1 · فارسی تخصصی: Whisper fine-tuned + LM فارسی

جمع‌بندی

از ژانویه تا خرداد ۱۴۰۵، بازار STT چهار تحول بزرگ داشت: Qwen3-ASR معماری LALM+RL را به open-source آورد، Voxtral نشان داد ۴B streaming می‌تواند رقیب مدل‌های بزرگ‌تر باشد، ElevenLabs Scribe v2 برای اولین بار WER و latency را همزمان بهینه کرد، و Microsoft با MAI-Transcribe-1 وارد رقابت مستقیم شد.

سه نکته کلیدی برای هر تیمی که در این حوزه کار می‌کند:

  • معیار انتخاب را تغییر دهید: WER دیگر تنها معیار نیست. AA-WER روی داده‌های متنوع، streaming latency، قابلیت fine-tuning، و هزینه inference همه در انتخاب نهایی اهمیت دارند.
  • برای فارسی، داده مهم‌تر از مدل است: Qwen3-ASR از ۵۲ زبان پشتیبانی می‌کند اما هنوز نیاز به fine-tuning اختصاصی فارسی دارد. تیمی که بهترین دیتاست domain-specific فارسی را بسازد — نه لزوماً بهترین مدل — برنده خواهد بود.
  • LALM آینده است — الان آماده شوید: pipeline‌های چندمرحله‌ای legacy در حال منسوخ شدن هستند. سرمایه‌گذاری روی معماری‌های یکپارچه ASR+LLM از همین حالا توجیه دارد.
Avatar photo
فاطمه وائلی

نظرات بسته شده است.