مقاله فنی · به‌روز تا خرداد ۱۴۰۵ / ۲۰۲۶

تبدیل متن به گفتار (TTS)
در دنیای امروز

از Concatenative تا Flow Matching و مدل‌های هیبریدی AR+LLM؛ مروری جامع بر معماری‌ها، مدل‌های برتر ۲۰۲۵–۲۰۲۶، چالش‌های فارسی، و مسیر آینده این فناوری

زمان مطالعه: ۱۴ دقیقه سطح: فنی + مدیریتی آخرین به‌روزرسانی: خرداد ۱۴۰۵

TTS چیست و چرا اهمیت دارد؟

Text-to-Speech یا سنتز گفتار، فناوری‌ای است که متن نوشتاری را به صدای گفتاری طبیعی تبدیل می‌کند. اما «طبیعی» در اینجا معنای عمیقی دارد — نه فقط تلفظ صحیح، بلکه prosody درست، احساس مناسب، مکث‌های طبیعی، و تن صدایی که شنونده را فراموش کند با یک ماشین در حال صحبت است.

اگر تا همین چند سال پیش TTS صرفاً ابزار accessibility بود، امروز موتور اصلی voice agent، audiobook، dubbing خودکار، و هوش مصنوعی مکالمه‌ای شده است. تفاوت بین یک voice agent که کاربر را جذب می‌کند و یکی که او را فراری می‌دهد، اغلب در کیفیت TTS است.

نقطه عطف ۲۰۲۶

در ۲۰۲۶ برای اولین بار مدل‌های open-source در blind test از ElevenLabs — بهترین سرویس تجاری — پیشی گرفتند. Chatterbox Turbo در آزمون کور ۶۵.۳٪ ترجیح شنوندگان را گرفت. این خط قرمزی بود که عبور از آن همه چیز را عوض کرد.

سیر تکامل معماری‌های TTS

TTS در پنج دوره مشخص تکامل یافته — هر دوره یک جهش کیفی بود نه صرفاً بهبود:

دهه ۱۹۸۰ – ۲۰۰۰
Concatenative TTS — چسباندن قطعات صوتی

رایانه واحدهای صوتی کوچک (دیفون یا واحدهای طولانی‌تر) را از یک corpus ضبط‌شده استخراج و به هم می‌چسباند. صدا مصنوعی و robotik بود، خطاهای مرز قطعات قابل شنیدن بودند. اما برای دهه‌ها تنها گزینه عملی بود.

Unit Selection · Diphone · Festival
۲۰۰۵ – ۲۰۱۷
Statistical Parametric TTS (HMM/DNN)

مدل‌های آماری پارامترهای صوتی (pitch، duration، spectral) را پیش‌بینی می‌کردند و سپس یک vocoder این پارامترها را به موج صوتی تبدیل می‌کرد. انعطاف‌پذیری بیشتر اما صدا هنوز «نرم» و بی‌روح بود.

HMM · MERLin · DNN · SPSS
۲۰۱۷ – ۲۰۲۱
Neural TTS — انقلاب WaveNet و Tacotron

WaveNet گوگل (۲۰۱۶) و Tacotron (۲۰۱۷) یک جهش کیفی واقعی ایجاد کردند. برای اولین بار صدای سنتزشده می‌توانست انسان‌ها را گمراه کند. مدل‌های دوبخشی (Acoustic model + Vocoder) استاندارد شدند: FastSpeech2 و HiFi-GAN این دوره را به اوج رساندند.

WaveNet · Tacotron2 · FastSpeech2 · HiFi-GAN · VITS
۲۰۲۲ – ۲۰۲۴
Zero-Shot & Diffusion — کلون صدا از چند ثانیه

مدل‌هایی مثل VALL-E، YourTTS، و NaturalSpeech 2 نشان دادند می‌توان صدای هر کسی را از چند ثانیه نمونه کلون کرد. Diffusion و Flow Matching جایگزین معماری‌های قدیمی شدند. XTTS v2 این قابلیت را به open-source آورد.

VALL-E · NaturalSpeech2 · XTTS-v2 · Diffusion · Flow Matching
۲۰۲۴ – اکنون (۲۰۲۶)
LLM-TTS + RL — احساس، طبیعی‌بودن، و کنترل کامل

نسل جدید از LLM به عنوان backbone استفاده می‌کنند (CosyVoice2، Fish Speech، Chatterbox) و با Reinforcement Learning fine-tune می‌شوند تا prosody طبیعی‌تر، کنترل احساس، و zero-shot voice cloning چند ثانیه‌ای ارائه دهند. Voxtral TTS از Mistral معماری هیبریدی AR + Flow Matching را معرفی کرد. F5R-TTS از GRPO برای بهبود همزمان WER و speaker similarity استفاده می‌کند.

LLM-TTS · CosyVoice2 · Flow Matching + RL · GRPO · Chatterbox · Voxtral

مدل‌های برتر ۲۰۲۵ — پایه‌های نسل جدید

این مدل‌ها در ۲۰۲۵ استاندارد صنعت شدند و بسیاری در production امروز همچنان استفاده می‌شوند:

بهترین کیفیت Commercial
ElevenLabs v3
ElevenLabs · June 2025
ویژگی کلیدیAudio Tags + احساس
Text to Dialogueبله
زبان‌هاگسترده‌ترین
نوعCommercial

اولین مدل با سیستم audio tag کامل — می‌توانید با تگ‌هایی مثل [laughs]، [sighs]، یا [excited] احساس را کنترل کنید. Text to Dialogue چند صدا را در یک خروجی ترکیب می‌کند. ElevenLabs دیگر فقط TTS نیست؛ یک پلتفرم کامل audio است.

سریع‌ترین Production
Cartesia Sonic 3 / 3.5
Cartesia · Late 2025 / May 2026
Latency~40ms (Turbo)
زبان‌ها42 زبان
صداها500+
Leaderboardموقتاً #1 (AA)

بهترین گزینه برای voice agent real-time که latency حرف اول را می‌زند. Sonic Turbo با ۴۰ms برای اپلیکیشن‌های مکالمه‌ای طراحی شده. Sonic 3.5 در مه ۲۰۲۶ با prosody بهتر و emotional range گسترده‌تر آمد.

بهترین Open-Source چندزبانه
Fish Speech V1.5
Fish Audio · 2025
ELO Score1339
Voice CloningZero-shot
زبان‌هاچندزبانه
لایسنسCC-BY-NC

بالاترین ELO در بین مدل‌های open-source چندزبانه. بر معماری LLM-based ساخته شده و zero-shot voice cloning با کیفیت بالا ارائه می‌دهد. برای اپلیکیشن‌های تولید محتوای چندزبانه.

بهترین Edge Open-Source
Kokoro (82M)
HexGrad · 2025
پارامترها82M
RTF96× real-time
معماریStyleTTS2 + ISTFTNet
لایسنسApache 2.0

کوچکترین مدلی که کیفیت commercial-grade دارد. ۸۲M پارامتر با ۹۶× real-time روی GPU معمولی. بدون encoder و diffusion — مستقیم و سریع. بهترین انتخاب برای edge deployment و سرویس‌هایی که هزینه inference مهم است.

Ultra-Low Latency Streaming
CosyVoice2-0.5B
Alibaba / FunAudioLLM · 2024–2025
Streaming Latency150ms
معماریLM + Flow Matching
Voice CloningZero-shot
لایسنسApache 2.0

بهترین latency streaming در بین مدل‌های open-source. از supervised semantic token (از ASR) برای کیفیت بهتر استفاده می‌کند. برای voice agent real-time که به self-hosting نیاز دارد.

Video Dubbing تخصصی
IndexTTS-2
IndexTeam · 2025
Duration Controlدقیق و مستقل
Emotion ControlZero-shot
تخصصVideo Dubbing
لایسنسOpen

مشکل اصلی dubbing خودکار این است که صدا باید در زمان دقیقی جا بگیرد. IndexTTS-2 کنترل duration را از emotion جدا کرده — می‌توان هر کدام را مستقل تنظیم کرد. ابزار اصلی تیم‌های post-production.

مدل‌های جدید ۲۰۲۶ تازه

مارس ۲۰۲۶ یک روز تاریخی برای TTS بود — سه مدل مهم در چند ساعت منتشر شدند و موج جدیدی از رقابت شکل گرفت:

جدید · مارس ۲۰۲۶
Chatterbox Turbo برنده blind test
Resemble AI · Dec 2025 / Updated 2026
Blind Test vs ElevenLabs65.3% ترجیح
Latency<150ms streaming
RTF~6.0× (RTX 4090)
لایسنسMIT

اولین مدل open-source که در آزمون کور از ElevenLabs پیشی گرفت — ۶۵.۳٪ شنوندگان آن را ترجیح دادند. آموزش روی ۵۰۰k+ ساعت صوت. Emotion control، zero-shot voice cloning، و streaming زیر ۱۵۰ms. فارسی هم fine-tune شده (توسط community).

جدید · مه ۲۰۲۶
Voxtral TTS (Mistral)
Mistral AI · May 2026
Blind Test vs ElevenLabs Flash62.8% ترجیح
معماریAR + Flow Matching هیبریدی
زبان‌هاچندزبانه
لایسنسOpen-weight

معماری هیبریدی منحصربه‌فرد: AR برای طبیعی‌بودن prosody + Flow Matching برای سرعت. در blind test ۶۲.۸٪ ترجیح داده شد و از نظر expressiveness با ElevenLabs v3 tier رقابت می‌کند. از نظر قیمت تقریباً یک‌پنجم ElevenLabs است.

جدید · مه ۲۰۲۶
OpenAI GPT-Realtime-2
OpenAI · May 2026
ویژگیGPT-5 class reasoning
Interruption Handlingبله
Translationبله (Realtime)
نوعCommercial

اولین voice model با استدلال GPT-5. Tool calls، مدیریت وقفه، و اصلاح real-time را پشتیبانی می‌کند. GPT-Realtime-Translate برای ترجمه زنده و GPT-Realtime-Whisper برای رونویسی real-time هم اضافه شدند. برای voice agent‌هایی که به reasoning نیاز دارند.

جدید · ۲۰۲۶
F5R-TTS (Flow Matching + RL)
FrontierLabs · 2026
WER بهبود vs F5-TTS29.5% کاهش
Speaker Similarity بهبود4.6% افزایش
معماریFlow Matching + GRPO-RL
تمرکزZero-shot Voice Cloning

مثل آنچه ASR با RL بهبود یافت، TTS هم همین مسیر را طی می‌کند. F5R-TTS از GRPO با dual reward (WER + Speaker Similarity) استفاده می‌کند. نتیجه: intelligibility و کیفیت voice cloning همزمان بهبود می‌یابند.

جدید · ۲۰۲۶
Inworld TTS MAX
Inworld AI · 2026
ELO1594
Latency Mini<130ms
Voice Cloningرایگان (included)
تمرکزGaming + Agent

بالاترین ELO در TTS Arena Leaderboard برای accessible models. Voice cloning در قیمت پایه included است — بر خلاف ElevenLabs که هزینه جداگانه دارد. Inworld Mini با زیر ۱۳۰ms برای gaming real-time طراحی شده.

جدید · ۲۰۲۶
Speechify SIMBA 3.0
Speechify · May 2026
Leaderboard رتبهTop 10 (AA)
قیمت~$10 / 1M char
ELO~1159
تمرکزCost-efficient

ارزان‌ترین مدل در top 10 leaderboard. برای تیم‌هایی که حجم بالای تولید صوت دارند و budget محدود — پایین‌ترین قیمت به‌ازای کیفیت مناسب.

روز تاریخی — مارس ۲۰۲۶

۲۶ مارس ۲۰۲۶ در کمتر از چند ساعت Voxtral TTS از Mistral، Transcribe از Cohere، و CoVo-Audio از Tencent منتشر شدند. یک کاربر در Reddit نوشت: “The on-prem voice stack is here.” — این جمله خلاصه‌ای کامل از آن روز بود.

مقایسه کمّی — MOS، ELO، و Latency

ارزیابی TTS با STT فرق اساسی دارد. در TTS معیار اصلی MOS (Mean Opinion Score) است — نظر انسان‌ها — نه یک عدد محاسباتی. در ۲۰۲۶ TTS Arena Leaderboard و Artificial Analysis هر دو از ELO مبتنی بر آزمون کور استفاده می‌کنند:

مدلELO / MOSLatencyVoice Cloningنوعقیمت تقریبی
Inworld TTS MAX ۲۰۲۶ELO 1594رایگان (included)Commercialمتوسط
ElevenLabs v3برتر75–150msهزینه جداCommercial$5–$1300/mo
Chatterbox Turbo ۲۰۲۶65.3% blind win<150msرایگان (MIT)Open (MIT)رایگان
Voxtral TTS ۲۰۲۶62.8% blind winZero-shotOpen-weight~1/5 ElevenLabs
Cartesia Sonic 3.5 ۲۰۲۶موقتاً #1 AA40ms (Turbo)محدودCommercialمتوسط
Fish Speech V1.5ELO 1339Zero-shotCC-BY-NCرایگان (non-com)
CosyVoice2-0.5Bخوب150ms streamingZero-shotOpen (Apache 2)رایگان
Kokoro (82M)خوب برای اندازه96× RTنداردOpen (Apache 2)رایگان
Speechify SIMBA 3.0 ۲۰۲۶ELO ~1159محدودCommercial$10/1M char
هشدار مقایسه

ELO و MOS به شدت به داده آزمون و جمعیت ارزیاب بستگی دارند. یک مدل که روی صدای کتاب‌خوانی عالی است ممکن است در voice agent مکالمه‌ای متوسط باشد. همیشه روی use case خودتان با شنوندگان واقعی‌تان test کنید.

Voice Cloning در ۲۰۲۶ — وضعیت فعلی

کلون صدا (تولید صدای یک فرد خاص از چند ثانیه نمونه) در ۲۰۲۶ به قابلیت عمومی تبدیل شده. اما با این قدرت، مسائل مهمی هم مطرح شده‌اند:

Zero-Shot از ۳ ثانیه

مدل‌هایی مثل Chatterbox، Fish Speech، و CosyVoice2 با فقط ۳–۱۰ ثانیه نمونه صدا کلون می‌کنند. Fine-tuning دیگر لازم نیست.

🌍
Cross-Lingual Cloning

می‌توان صدای یک فارسی‌زبان را کلون کرد و با آن انگلیسی یا ژاپنی گفت — بدون accent فارسی. این برای dubbing بین‌المللی انقلابی است.

🛡️
Watermarking و تشخیص

Resemble AI، ElevenLabs، و گوگل سیستم‌های watermarking صوتی دارند. تشخیص deepfake صوتی به یک حوزه تحقیقاتی مستقل تبدیل شده.

⚖️
چارچوب قانونی

اتحادیه اروپا و چند ایالت آمریکا قوانین محدودکننده تصویب کرده‌اند. کلون صدا بدون رضایت صاحب صدا در اکثر platformها ممنوع است.

🎭
Emotion Disentanglement

مدل‌های جدید می‌توانند هویت صدا را از احساس جدا کنند — همان صدا را با شادی یا غم بسازند بدون اینکه هویت تغییر کند.

🏢
Professional Cloning

ElevenLabs Professional Voice Cloning برای production-grade نیاز به ۳۰ دقیقه ضبط باکیفیت دارد. کیفیت به‌مراتب بهتر از zero-shot است.

چرا TTS فارسی یک مسئله منحصربه‌فرد است؟

TTS فارسی چالش‌هایی دارد که با STT فارسی متفاوت‌اند — و در برخی ابعاد سخت‌تر، چون TTS به داده‌های بسیار تمیزتر نیاز دارد:

📖
کمبود حرکت‌گذاری (Diacritization)

فارسی در نوشتار روزمره حرکت (اعراب) ندارد. «مَدرسه» یا «مَدرِسه»؟ مدل باید از بافت جمله تشخیص دهد — اشتباه در تلفظ خروجی را غیرطبیعی می‌کند.

🔤
نرمالیزاسیون متن پیچیده

اعداد (فارسی/عربی/لاتین)، تاریخ‌ها، واحدها، abbreviationها، و ایموجی — هر کدام باید به شکل صحیح خوانده شوند. این Frontend TTS برای فارسی بسیار پیچیده‌تر از انگلیسی است.

🎙️
کمبود داده TTS-grade

داده TTS باید بسیار تمیزتر از داده ASR باشد: بدون نویز، با تلفظ کامل، سمپل‌ریت بالا. ManaTTS و ParsVoice پیشرفت‌هایی ایجاد کرده‌اند اما هنوز کافی نیست.

🗣️
Prosody فارسی

الگوی تکیه و آهنگ فارسی با انگلیسی کاملاً متفاوت است. مدلی که فقط روی انگلیسی آموزش دیده وقتی فارسی تولید می‌کند intonation نادرستی دارد.

🔢
کلمات دخیل و code-switching

فارسی روزمره پر از کلمات انگلیسی، فرانسوی، و عربی است که هر کدام قاعده تلفظ متفاوتی دارند. مدل باید بداند «سافتور» را فارسی بخواند نه انگلیسی.

👥
تنوع گوینده محدود در داده

اکثر دیتاست‌های TTS فارسی تک‌گوینده یا چند گوینده محدود هستند. مدلی که روی آن‌ها آموزش ببیند در voice cloning کیفیت پایین‌تری دارد.

اعداد واقعی

بهترین مدل TTS فارسی open-source موجود (مبتنی بر Tacotron2 + ManaTTS) به MOS حدود 3.76 رسیده — در مقایسه با MOS ۴.۵+ که ElevenLabs برای انگلیسی ادعا می‌کند. این شکاف نشان می‌دهد TTS فارسی با کیفیت واقعاً بالا هنوز یک مسئله حل‌نشده است.

وضعیت TTS فارسی در ۲۰۲۶

مدل / رویکردنوعوضعیتنکته
Chatterbox Fine-tuned فارسی ۲۰۲۵Open-source + Communityموجود (HuggingFace)Community fine-tune روی فارسی موجود است. کیفیت برای استفاده عمومی قابل قبول اما نه production-grade
Tacotron2 + ManaTTSOpen-source اختصاصیبهترین Open-sourceManaTTS: ۱۱۴ ساعت داده تک‌گوینده باکیفیت. بهترین baseline برای TTS فارسی. MOS 3.76
VITS فارسی (ZabanZad.ai)Open-sourceپژوهشیپروژه SAIL Lab با هدف TTS فارسی production-grade. در مرحله توسعه است
ParsVoice (Multi-speaker) ۲۰۲۵Datasetمنتشر شدهاولین corpus چندگوینده بزرگ‌مقیاس فارسی. از IranSeda استخراج شده. پایه آموزش مدل‌های چندگوینده فارسی
XTTS v2 + Fine-tuning فارسیOpen-source + سفارشینیاز به کاربا ۶ دقیقه داده فارسی می‌توان fine-tune کرد اما نرمالیزاسیون متن فارسی باید مستقل پیاده‌سازی شود
سرویس‌های تجاری ایرانیCommercialمحدودبرخی شرکت‌های ایرانی TTS فارسی دارند (مثل سرویس بلد) اما open access ندارند و کیفیت متفاوت است

رویکرد عملی پیشنهادی برای TTS فارسی

  • کوتاه‌مدت: XTTS v2 یا Chatterbox با fine-tuning روی دیتاست اختصاصی خودتان — حداقل ۳۰ دقیقه صوت تمیز و labeled
  • Frontend حیاتی است: یک ماژول نرمالیزاسیون متن فارسی قوی بسازید — اعداد، تاریخ، abbreviation، کلمات انگلیسی. این بیشتر از انتخاب مدل اهمیت دارد
  • Grapheme-to-Phoneme: یک G2P فارسی دقیق برای مدل‌هایی که phoneme می‌گیرند ضروری است — خصوصاً برای کلمات عربی و انگلیسی در متن فارسی
  • میان‌مدت: آموزش روی ParsVoice برای چندگوینده. این داده چندگوینده است و voice cloning بهتری خواهید داشت
  • بلندمدت: Fine-tuning Voxtral TTS (وقتی به فارسی تعمیم یافت) با دیتاست domain-specific — این مسیر احتمالاً بهترین کیفیت را خواهد داد
فرصت بزرگ بازار

TTS فارسی با صدای طبیعی، چندگوینده، و قابل کلون — با MOS بالای ۴ — هنوز وجود ندارد. هر تیمی که این را بسازد و به‌صورت API عرضه کند، بازار ایران، افغانستان، و تاجیکستان را به دست خواهد داشت. اولین قدم ساختن یک دیتاست چندگوینده تمیز است.

کاربردهای صنعتی TTS

🤖
Voice Agent
مرکز تماس هوشمند، دستیار صوتی، پشتیبانی خودکار
📚
Audiobook
تبدیل کتاب به صدا، محتوای آموزشی، podcast خودکار
🎮
Gaming
دیالوگ داینامیک NPC، روایت پویا، شخصی‌سازی صدا
🎬
Dubbing
دوبله خودکار، ترجمه و سنتز همزمان، localization
Accessibility
screen reader، کمک به نابینایان، ابزار ارتباطی
📱
Navigation
دستیار خودرو، مسیریابی، اعلانات هوشمند
🎓
آموزش
زبان‌آموزی با تلفظ استاندارد، محتوای e-learning
📰
رسانه
خوانش خبر، تبدیل مقاله به صدا، پادکست خودکار
راهنمای انتخاب سریع ۲۰۲۶

بالاترین کیفیت + احساس: ElevenLabs v3 · کمترین latency (40ms): Cartesia Sonic Turbo · بهترین open-source blind: Chatterbox Turbo · چندزبانه open: Fish Speech V1.5 · Edge/On-device: Kokoro 82M · Streaming open: CosyVoice2-0.5B · Dubbing: IndexTTS-2 · فارسی: Tacotron2 + ManaTTS + نرمالیزاسیون اختصاصی

جمع‌بندی

TTS در ۲۰۲۶ وارد مرحله‌ای شده که «کافی بودن» دیگر کافی نیست. وقتی Chatterbox Turbo با MIT license در blind test از ElevenLabs پیشی می‌گیرد، معنایش این است که هر تیمی با منابع معقول می‌تواند یک TTS تجاری‌گرا بسازد.

سه نکته کلیدی برای تیم‌های فعال در این حوزه:

  • معماری AR+Flow Matching+RL آینده است: مدل‌هایی که هر سه عنصر را ترکیب کنند — مثل Voxtral — بهترین balance بین کیفیت، سرعت، و کنترل‌پذیری را دارند. این معماری در دو سال آینده استاندارد خواهد شد.
  • برای فارسی، Frontend مهم‌تر از مدل است: یک ماژول نرمالیزاسیون متن فارسی قوی — که اعداد، تاریخ‌ها، کلمات انگلیسی، و اصطلاحات تخصصی را درست تبدیل کند — اثر بیشتری از انتخاب بهترین مدل دارد.
  • داده چندگوینده فارسی جای خالی اصلی است: ParsVoice قدم بزرگی بود، اما هنوز به corpus بزرگ‌تر، متنوع‌تر، و با domain-coverage بیشتر نیاز داریم. تیمی که این داده را بسازد، برنده بازار TTS فارسی خواهد بود.
Avatar photo
فاطمه وائلی

نظرات بسته شده است.