تبدیل متن به گفتار (TTS)
در دنیای امروز
از Concatenative تا Flow Matching و مدلهای هیبریدی AR+LLM؛ مروری جامع بر معماریها، مدلهای برتر ۲۰۲۵–۲۰۲۶، چالشهای فارسی، و مسیر آینده این فناوری
TTS چیست و چرا اهمیت دارد؟
Text-to-Speech یا سنتز گفتار، فناوریای است که متن نوشتاری را به صدای گفتاری طبیعی تبدیل میکند. اما «طبیعی» در اینجا معنای عمیقی دارد — نه فقط تلفظ صحیح، بلکه prosody درست، احساس مناسب، مکثهای طبیعی، و تن صدایی که شنونده را فراموش کند با یک ماشین در حال صحبت است.
اگر تا همین چند سال پیش TTS صرفاً ابزار accessibility بود، امروز موتور اصلی voice agent، audiobook، dubbing خودکار، و هوش مصنوعی مکالمهای شده است. تفاوت بین یک voice agent که کاربر را جذب میکند و یکی که او را فراری میدهد، اغلب در کیفیت TTS است.
در ۲۰۲۶ برای اولین بار مدلهای open-source در blind test از ElevenLabs — بهترین سرویس تجاری — پیشی گرفتند. Chatterbox Turbo در آزمون کور ۶۵.۳٪ ترجیح شنوندگان را گرفت. این خط قرمزی بود که عبور از آن همه چیز را عوض کرد.
سیر تکامل معماریهای TTS
TTS در پنج دوره مشخص تکامل یافته — هر دوره یک جهش کیفی بود نه صرفاً بهبود:
رایانه واحدهای صوتی کوچک (دیفون یا واحدهای طولانیتر) را از یک corpus ضبطشده استخراج و به هم میچسباند. صدا مصنوعی و robotik بود، خطاهای مرز قطعات قابل شنیدن بودند. اما برای دههها تنها گزینه عملی بود.
Unit Selection · Diphone · Festivalمدلهای آماری پارامترهای صوتی (pitch، duration، spectral) را پیشبینی میکردند و سپس یک vocoder این پارامترها را به موج صوتی تبدیل میکرد. انعطافپذیری بیشتر اما صدا هنوز «نرم» و بیروح بود.
HMM · MERLin · DNN · SPSSWaveNet گوگل (۲۰۱۶) و Tacotron (۲۰۱۷) یک جهش کیفی واقعی ایجاد کردند. برای اولین بار صدای سنتزشده میتوانست انسانها را گمراه کند. مدلهای دوبخشی (Acoustic model + Vocoder) استاندارد شدند: FastSpeech2 و HiFi-GAN این دوره را به اوج رساندند.
WaveNet · Tacotron2 · FastSpeech2 · HiFi-GAN · VITSمدلهایی مثل VALL-E، YourTTS، و NaturalSpeech 2 نشان دادند میتوان صدای هر کسی را از چند ثانیه نمونه کلون کرد. Diffusion و Flow Matching جایگزین معماریهای قدیمی شدند. XTTS v2 این قابلیت را به open-source آورد.
VALL-E · NaturalSpeech2 · XTTS-v2 · Diffusion · Flow Matchingنسل جدید از LLM به عنوان backbone استفاده میکنند (CosyVoice2، Fish Speech، Chatterbox) و با Reinforcement Learning fine-tune میشوند تا prosody طبیعیتر، کنترل احساس، و zero-shot voice cloning چند ثانیهای ارائه دهند. Voxtral TTS از Mistral معماری هیبریدی AR + Flow Matching را معرفی کرد. F5R-TTS از GRPO برای بهبود همزمان WER و speaker similarity استفاده میکند.
LLM-TTS · CosyVoice2 · Flow Matching + RL · GRPO · Chatterbox · Voxtralمدلهای برتر ۲۰۲۵ — پایههای نسل جدید
این مدلها در ۲۰۲۵ استاندارد صنعت شدند و بسیاری در production امروز همچنان استفاده میشوند:
اولین مدل با سیستم audio tag کامل — میتوانید با تگهایی مثل [laughs]، [sighs]، یا [excited] احساس را کنترل کنید. Text to Dialogue چند صدا را در یک خروجی ترکیب میکند. ElevenLabs دیگر فقط TTS نیست؛ یک پلتفرم کامل audio است.
بهترین گزینه برای voice agent real-time که latency حرف اول را میزند. Sonic Turbo با ۴۰ms برای اپلیکیشنهای مکالمهای طراحی شده. Sonic 3.5 در مه ۲۰۲۶ با prosody بهتر و emotional range گستردهتر آمد.
بالاترین ELO در بین مدلهای open-source چندزبانه. بر معماری LLM-based ساخته شده و zero-shot voice cloning با کیفیت بالا ارائه میدهد. برای اپلیکیشنهای تولید محتوای چندزبانه.
کوچکترین مدلی که کیفیت commercial-grade دارد. ۸۲M پارامتر با ۹۶× real-time روی GPU معمولی. بدون encoder و diffusion — مستقیم و سریع. بهترین انتخاب برای edge deployment و سرویسهایی که هزینه inference مهم است.
بهترین latency streaming در بین مدلهای open-source. از supervised semantic token (از ASR) برای کیفیت بهتر استفاده میکند. برای voice agent real-time که به self-hosting نیاز دارد.
مشکل اصلی dubbing خودکار این است که صدا باید در زمان دقیقی جا بگیرد. IndexTTS-2 کنترل duration را از emotion جدا کرده — میتوان هر کدام را مستقل تنظیم کرد. ابزار اصلی تیمهای post-production.
مدلهای جدید ۲۰۲۶ تازه
مارس ۲۰۲۶ یک روز تاریخی برای TTS بود — سه مدل مهم در چند ساعت منتشر شدند و موج جدیدی از رقابت شکل گرفت:
اولین مدل open-source که در آزمون کور از ElevenLabs پیشی گرفت — ۶۵.۳٪ شنوندگان آن را ترجیح دادند. آموزش روی ۵۰۰k+ ساعت صوت. Emotion control، zero-shot voice cloning، و streaming زیر ۱۵۰ms. فارسی هم fine-tune شده (توسط community).
معماری هیبریدی منحصربهفرد: AR برای طبیعیبودن prosody + Flow Matching برای سرعت. در blind test ۶۲.۸٪ ترجیح داده شد و از نظر expressiveness با ElevenLabs v3 tier رقابت میکند. از نظر قیمت تقریباً یکپنجم ElevenLabs است.
اولین voice model با استدلال GPT-5. Tool calls، مدیریت وقفه، و اصلاح real-time را پشتیبانی میکند. GPT-Realtime-Translate برای ترجمه زنده و GPT-Realtime-Whisper برای رونویسی real-time هم اضافه شدند. برای voice agentهایی که به reasoning نیاز دارند.
مثل آنچه ASR با RL بهبود یافت، TTS هم همین مسیر را طی میکند. F5R-TTS از GRPO با dual reward (WER + Speaker Similarity) استفاده میکند. نتیجه: intelligibility و کیفیت voice cloning همزمان بهبود مییابند.
بالاترین ELO در TTS Arena Leaderboard برای accessible models. Voice cloning در قیمت پایه included است — بر خلاف ElevenLabs که هزینه جداگانه دارد. Inworld Mini با زیر ۱۳۰ms برای gaming real-time طراحی شده.
ارزانترین مدل در top 10 leaderboard. برای تیمهایی که حجم بالای تولید صوت دارند و budget محدود — پایینترین قیمت بهازای کیفیت مناسب.
۲۶ مارس ۲۰۲۶ در کمتر از چند ساعت Voxtral TTS از Mistral، Transcribe از Cohere، و CoVo-Audio از Tencent منتشر شدند. یک کاربر در Reddit نوشت: “The on-prem voice stack is here.” — این جمله خلاصهای کامل از آن روز بود.
مقایسه کمّی — MOS، ELO، و Latency
ارزیابی TTS با STT فرق اساسی دارد. در TTS معیار اصلی MOS (Mean Opinion Score) است — نظر انسانها — نه یک عدد محاسباتی. در ۲۰۲۶ TTS Arena Leaderboard و Artificial Analysis هر دو از ELO مبتنی بر آزمون کور استفاده میکنند:
| مدل | ELO / MOS | Latency | Voice Cloning | نوع | قیمت تقریبی |
|---|---|---|---|---|---|
| Inworld TTS MAX ۲۰۲۶ | ELO 1594 | — | رایگان (included) | Commercial | متوسط |
| ElevenLabs v3 | برتر | 75–150ms | هزینه جدا | Commercial | $5–$1300/mo |
| Chatterbox Turbo ۲۰۲۶ | 65.3% blind win | <150ms | رایگان (MIT) | Open (MIT) | رایگان |
| Voxtral TTS ۲۰۲۶ | 62.8% blind win | — | Zero-shot | Open-weight | ~1/5 ElevenLabs |
| Cartesia Sonic 3.5 ۲۰۲۶ | موقتاً #1 AA | 40ms (Turbo) | محدود | Commercial | متوسط |
| Fish Speech V1.5 | ELO 1339 | — | Zero-shot | CC-BY-NC | رایگان (non-com) |
| CosyVoice2-0.5B | خوب | 150ms streaming | Zero-shot | Open (Apache 2) | رایگان |
| Kokoro (82M) | خوب برای اندازه | 96× RT | ندارد | Open (Apache 2) | رایگان |
| Speechify SIMBA 3.0 ۲۰۲۶ | ELO ~1159 | — | محدود | Commercial | $10/1M char |
ELO و MOS به شدت به داده آزمون و جمعیت ارزیاب بستگی دارند. یک مدل که روی صدای کتابخوانی عالی است ممکن است در voice agent مکالمهای متوسط باشد. همیشه روی use case خودتان با شنوندگان واقعیتان test کنید.
Voice Cloning در ۲۰۲۶ — وضعیت فعلی
کلون صدا (تولید صدای یک فرد خاص از چند ثانیه نمونه) در ۲۰۲۶ به قابلیت عمومی تبدیل شده. اما با این قدرت، مسائل مهمی هم مطرح شدهاند:
مدلهایی مثل Chatterbox، Fish Speech، و CosyVoice2 با فقط ۳–۱۰ ثانیه نمونه صدا کلون میکنند. Fine-tuning دیگر لازم نیست.
میتوان صدای یک فارسیزبان را کلون کرد و با آن انگلیسی یا ژاپنی گفت — بدون accent فارسی. این برای dubbing بینالمللی انقلابی است.
Resemble AI، ElevenLabs، و گوگل سیستمهای watermarking صوتی دارند. تشخیص deepfake صوتی به یک حوزه تحقیقاتی مستقل تبدیل شده.
اتحادیه اروپا و چند ایالت آمریکا قوانین محدودکننده تصویب کردهاند. کلون صدا بدون رضایت صاحب صدا در اکثر platformها ممنوع است.
مدلهای جدید میتوانند هویت صدا را از احساس جدا کنند — همان صدا را با شادی یا غم بسازند بدون اینکه هویت تغییر کند.
ElevenLabs Professional Voice Cloning برای production-grade نیاز به ۳۰ دقیقه ضبط باکیفیت دارد. کیفیت بهمراتب بهتر از zero-shot است.
چرا TTS فارسی یک مسئله منحصربهفرد است؟
TTS فارسی چالشهایی دارد که با STT فارسی متفاوتاند — و در برخی ابعاد سختتر، چون TTS به دادههای بسیار تمیزتر نیاز دارد:
فارسی در نوشتار روزمره حرکت (اعراب) ندارد. «مَدرسه» یا «مَدرِسه»؟ مدل باید از بافت جمله تشخیص دهد — اشتباه در تلفظ خروجی را غیرطبیعی میکند.
اعداد (فارسی/عربی/لاتین)، تاریخها، واحدها، abbreviationها، و ایموجی — هر کدام باید به شکل صحیح خوانده شوند. این Frontend TTS برای فارسی بسیار پیچیدهتر از انگلیسی است.
داده TTS باید بسیار تمیزتر از داده ASR باشد: بدون نویز، با تلفظ کامل، سمپلریت بالا. ManaTTS و ParsVoice پیشرفتهایی ایجاد کردهاند اما هنوز کافی نیست.
الگوی تکیه و آهنگ فارسی با انگلیسی کاملاً متفاوت است. مدلی که فقط روی انگلیسی آموزش دیده وقتی فارسی تولید میکند intonation نادرستی دارد.
فارسی روزمره پر از کلمات انگلیسی، فرانسوی، و عربی است که هر کدام قاعده تلفظ متفاوتی دارند. مدل باید بداند «سافتور» را فارسی بخواند نه انگلیسی.
اکثر دیتاستهای TTS فارسی تکگوینده یا چند گوینده محدود هستند. مدلی که روی آنها آموزش ببیند در voice cloning کیفیت پایینتری دارد.
بهترین مدل TTS فارسی open-source موجود (مبتنی بر Tacotron2 + ManaTTS) به MOS حدود 3.76 رسیده — در مقایسه با MOS ۴.۵+ که ElevenLabs برای انگلیسی ادعا میکند. این شکاف نشان میدهد TTS فارسی با کیفیت واقعاً بالا هنوز یک مسئله حلنشده است.
وضعیت TTS فارسی در ۲۰۲۶
| مدل / رویکرد | نوع | وضعیت | نکته |
|---|---|---|---|
| Chatterbox Fine-tuned فارسی ۲۰۲۵ | Open-source + Community | موجود (HuggingFace) | Community fine-tune روی فارسی موجود است. کیفیت برای استفاده عمومی قابل قبول اما نه production-grade |
| Tacotron2 + ManaTTS | Open-source اختصاصی | بهترین Open-source | ManaTTS: ۱۱۴ ساعت داده تکگوینده باکیفیت. بهترین baseline برای TTS فارسی. MOS 3.76 |
| VITS فارسی (ZabanZad.ai) | Open-source | پژوهشی | پروژه SAIL Lab با هدف TTS فارسی production-grade. در مرحله توسعه است |
| ParsVoice (Multi-speaker) ۲۰۲۵ | Dataset | منتشر شده | اولین corpus چندگوینده بزرگمقیاس فارسی. از IranSeda استخراج شده. پایه آموزش مدلهای چندگوینده فارسی |
| XTTS v2 + Fine-tuning فارسی | Open-source + سفارشی | نیاز به کار | با ۶ دقیقه داده فارسی میتوان fine-tune کرد اما نرمالیزاسیون متن فارسی باید مستقل پیادهسازی شود |
| سرویسهای تجاری ایرانی | Commercial | محدود | برخی شرکتهای ایرانی TTS فارسی دارند (مثل سرویس بلد) اما open access ندارند و کیفیت متفاوت است |
رویکرد عملی پیشنهادی برای TTS فارسی
- کوتاهمدت: XTTS v2 یا Chatterbox با fine-tuning روی دیتاست اختصاصی خودتان — حداقل ۳۰ دقیقه صوت تمیز و labeled
- Frontend حیاتی است: یک ماژول نرمالیزاسیون متن فارسی قوی بسازید — اعداد، تاریخ، abbreviation، کلمات انگلیسی. این بیشتر از انتخاب مدل اهمیت دارد
- Grapheme-to-Phoneme: یک G2P فارسی دقیق برای مدلهایی که phoneme میگیرند ضروری است — خصوصاً برای کلمات عربی و انگلیسی در متن فارسی
- میانمدت: آموزش روی ParsVoice برای چندگوینده. این داده چندگوینده است و voice cloning بهتری خواهید داشت
- بلندمدت: Fine-tuning Voxtral TTS (وقتی به فارسی تعمیم یافت) با دیتاست domain-specific — این مسیر احتمالاً بهترین کیفیت را خواهد داد
TTS فارسی با صدای طبیعی، چندگوینده، و قابل کلون — با MOS بالای ۴ — هنوز وجود ندارد. هر تیمی که این را بسازد و بهصورت API عرضه کند، بازار ایران، افغانستان، و تاجیکستان را به دست خواهد داشت. اولین قدم ساختن یک دیتاست چندگوینده تمیز است.
مسیر آینده TTS — به کجا میرویم؟
همانطور که Qwen3-ASR با GSPO-RL در ASR انقلاب ایجاد کرد، F5R-TTS و GLM-TTS نشان دادند RL با GRPO میتواند intelligibility و speaker similarity را همزمان بهبود دهد. در ۲۰۲۷ اکثر مدلهای پیشرو از RL استفاده خواهند کرد.
GPT-Realtime-2 مسیر را نشان داد: نه STT → LLM → TTS بلکه یک مدل یکپارچه که مستقیماً صدا را میفهمد و صدا جواب میدهد. این latency را از ۸۰۰ms به زیر ۳۰۰ms میبرد و کیفیت مکالمه را بهطور اساسی بهبود میدهد.
ElevenLabs v3 با audio tags شروع کرد، اما مسیر به سمت مدلهایی میرود که این حالتها را خودشان از بافت متن استنباط کنند. یک TTS که بفهمد «این جمله باید با تردید گفته شود» نه اینکه برنامهنویس تگ بنویسد.
Kokoro با ۸۲M پارامتر کیفیت commercial-grade دارد. مسیر به سمت مدلهایی میرود که روی گوشی هوشمند در real-time اجرا شوند. این برای حریم خصوصی، offline mode، و بازارهایی با اینترنت محدود اهمیت ویژه دارد.
ترکیب zero-shot voice cloning + RL fine-tuning امکان میدهد هر کاربر یک voice profile شخصی داشته باشد. دستیار AI شما با صدای خودتان حرف میزند — یا با صدایی که دقیقاً طبق preference شما طراحی شده.
کاربردهای صنعتی TTS
بالاترین کیفیت + احساس: ElevenLabs v3 · کمترین latency (40ms): Cartesia Sonic Turbo · بهترین open-source blind: Chatterbox Turbo · چندزبانه open: Fish Speech V1.5 · Edge/On-device: Kokoro 82M · Streaming open: CosyVoice2-0.5B · Dubbing: IndexTTS-2 · فارسی: Tacotron2 + ManaTTS + نرمالیزاسیون اختصاصی
جمعبندی
TTS در ۲۰۲۶ وارد مرحلهای شده که «کافی بودن» دیگر کافی نیست. وقتی Chatterbox Turbo با MIT license در blind test از ElevenLabs پیشی میگیرد، معنایش این است که هر تیمی با منابع معقول میتواند یک TTS تجاریگرا بسازد.
سه نکته کلیدی برای تیمهای فعال در این حوزه:
- معماری AR+Flow Matching+RL آینده است: مدلهایی که هر سه عنصر را ترکیب کنند — مثل Voxtral — بهترین balance بین کیفیت، سرعت، و کنترلپذیری را دارند. این معماری در دو سال آینده استاندارد خواهد شد.
- برای فارسی، Frontend مهمتر از مدل است: یک ماژول نرمالیزاسیون متن فارسی قوی — که اعداد، تاریخها، کلمات انگلیسی، و اصطلاحات تخصصی را درست تبدیل کند — اثر بیشتری از انتخاب بهترین مدل دارد.
- داده چندگوینده فارسی جای خالی اصلی است: ParsVoice قدم بزرگی بود، اما هنوز به corpus بزرگتر، متنوعتر، و با domain-coverage بیشتر نیاز داریم. تیمی که این داده را بسازد، برنده بازار TTS فارسی خواهد بود.