تحويل النص إلى كلام (TTS)
في عالم اليوم
من النماذج المتسلسلة (Concatenative) إلى مطابقة التدفق (Flow Matching) والنماذج الهجينة AR+LLM؛ مراجعة شاملة للبنى، وأفضل نماذج 2025-2026، والتحديات في اللغة الفارسية، والمسار المستقبلي لهذه التقنية.
ما هو تحويل النص إلى كلام (TTS) ولماذا يحظى بهذه الأهمية؟
تحويل النص إلى كلام (Text-to-Speech) أو توليد الكلام هو التقنية التي تحول النص المكتوب إلى صوت ناطق طبيعي. لكن كلمة “طبيعي” هنا تحمل معنى أعمق — فليست مجرد نطق صحيح للكلمات، بل تشمل إيقاعاً سليماً، ومشاعر مناسبة، ووقفات طبيعية، ونبرة صوت تجعل المستمع ينسى أنه يتحدث إلى آلة.
إذا كان نظام TTS حتى وقت قريب مجرد أداة لإمكانية الوصول (accessibility)، فإنه اليوم المحرك الأساسي للوكلاء الصوتيين (voice agents)، والكتب الصوتية، والدبلجة الآلية، والذكاء الاصطناعي الحواري. الفارق بين الوكيل الصوتي الذي يجذب المستخدم وبين الذي ينفره، يكمن غالباً في جودة تقنية الـ TTS.
في عام 2026، ولأول مرة، تفوقت النماذج مفتوحة المصدر في التقييم الأعمى (blind test) على منصة ElevenLabs — أفضل خدمة تجارية آنذاك. حاز نموذج Chatterbox Turbo على تفضيل المستمعين بنسبة 65.3% في التقييم الأعمى. كانت هذه هي النقطة الفارقة التي غيرت موازين اللعبة.
مسار تطور بنى الـ TTS
تطورت تقنية TTS عبر خمس حقب متميزة — كل حقبة مثلت قفزة نوعية وليست مجرد تحسين عابر:
كان الحاسوب يستخرج وحدات صوتية صغيرة (مقطعية أو أطول) من مجموعة تسجيلات ويربطها ببعضها. كان الصوت اصطناعياً وروبوتياً، وكانت فواصل الربط مسموعة. ورغم ذلك، كان الخيار العملي الوحيد لعقود.
Unit Selection · Diphone · Festivalكانت النماذج الإحصائية تتنبأ بالمعلمات الصوتية (الطبقة، المدة الزمنية، الطيف)، ثم يقوم مُرَمِّز صوتي (vocoder) بتحويل هذه المعلمات إلى موجة صوتية. وفرت مرونة أكبر، لكن الصوت ظل “خافتاً” وبلا روح.
HMM · MERLin · DNN · SPSSأحدث WaveNet من جوجل (2016) و Tacotron (2017) قفزة نوعية حقيقية. لأول مرة، تمكن الصوت المُولَّد من خداع البشر. أصبحت النماذج الثنائية الأجزاء (نموذج صوتي + مُرَمِّز) هي المعيار، لتبلغ ذروتها مع FastSpeech2 و HiFi-GAN.
WaveNet · Tacotron2 · FastSpeech2 · HiFi-GAN · VITSأثبتت نماذج مثل VALL-E و YourTTS و NaturalSpeech 2 إمكانية استنساخ صوت أي شخص من عينة صوتية لبضع ثوانٍ فقط. حلت نماذج الانتشار ومطابقة التدفق محل النماذج القديمة، وجلب XTTS v2 هذه القدرة إلى عالم المصادر المفتوحة.
VALL-E · NaturalSpeech2 · XTTS-v2 · Diffusion · Flow Matchingيستخدم الجيل الجديد نماذج اللغة الكبيرة (LLMs) كبنية أساسية (مثل CosyVoice2 و Fish Speech و Chatterbox) ويتم ضبطها بالتعلم المعزز لتقديم إيقاع طبيعي أكثر، وتحكم في المشاعر، واستنساخ فوري للصوت. قدم نموذج Voxtral TTS من Mistral بنية هجينة تجمع بين AR ومطابقة التدفق، ويستخدم F5R-TTS خوارزمية GRPO لتحسين معدل الخطأ (WER) وتشابه الصوت في وقت واحد.
LLM-TTS · CosyVoice2 · Flow Matching + RL · GRPO · Chatterbox · Voxtralأفضل نماذج 2025 — أسس الجيل الجديد
أصبحت هذه النماذج هي المعيار الصناعي في عام 2025 ولا يزال الكثير منها مستخدماً بكثافة حتى اليوم:
أول نموذج يضم نظام علامات صوتية متكامل — يمكنك التحكم في المشاعر باستخدام علامات مثل [ضحك]، [تنهيدة]، أو [متحمس]. تدمج خاصية (Text to Dialogue) عدة أصوات في مخرَج واحد. لم تعد ElevenLabs مجرد TTS، بل أصبحت منصة صوتية متكاملة.
الخيار الأمثل للوكلاء الصوتيين في الوقت الفعلي حيث يلعب زمن الانتقال دوراً حاسماً. طُرح Sonic Turbo بزمن 40ms خصيصاً لتطبيقات المحادثة، وجاء تحديث Sonic 3.5 بنبرات أطول ومجال عاطفي أوسع.
يحظى بأعلى تقييم ELO بين النماذج مفتوحة المصدر المتعددة اللغات. مبني على هندسة LLM، ويوفر قدرة استنساخ صوتية عالية الجودة دون تدريب مسبق. مثالي لتطبيقات صناعة المحتوى المتعددة اللغات.
أصغر نموذج يقدم جودة بمستوى تجاري. بحجم 82 مليون معلمة وسرعة 96 ضعف الزمن الفعلي على بطاقات رسومية عادية. بلا مشفرات أو نماذج انتشار — مباشر وسريع، ويعتبر الأفضل لتشغيل الخدمات المحلّية بتكلفة منخفضة.
أفضل زمن استجابة متدفق (streaming latency) ضمن النماذج مفتوحة المصدر. يستخدم رموز دلالية خاضعة للإشراف للحصول على جودة أعلى. موجه لتطبيقات الوكلاء الصوتيين التي تتطلب استضافة ذاتية.
المشكلة الرئيسية في الدبلجة الآلية هي ضرورة ملاءمة الصوت في وقت زمني محدد بدقة. يفصل نموذج IndexTTS-2 بين التحكم في المدة الزمنية والمشاعر، مما يسمح بضبطهما بصورة مستقلة. وهو أداة أساسية لفرق ما بعد الإنتاج (post-production).
نماذج جديدة لعام 2026 جديد
كان مارس 2026 يوماً تاريخياً لتقنية TTS — حيث صدرت ثلاثة نماذج كبرى خلال بضع ساعات، مما أشعل موجة جديدة من المنافسة:
أول نموذج مفتوح المصدر يتغلب على ElevenLabs في التقييم الأعمى — فضّله 65.3% من المستمعين. تم تدريبه على أكثر من 500 ألف ساعة صوتية. يدعم التحكم العاطفي، واستنساخ الصوت بلا تدريب (zero-shot)، وزمن بث أقل من 150ms. كما تم ضبطه للعمل باللغة الفارسية (عبر مجتمع المطورين).
بنية هجينة فريدة: AR للتركيب الإيقاعي الطبيعي + مطابقة التدفق للسرعة. فُضّل في الاختبارات العمياء بنسبة 62.8% وينافس جودة ElevenLabs في التعبيرية العالية بتكلفة تعادل تقريباً خُمس سعره.
أول نموذج صوتي بقدرات استدلال تواكب GPT-5. يدعم استدعاء الأدوات، وإدارة المقاطعات الصوتية، والتصحيح اللحظي، مع خصائص الترجمة والنسخ المباشر. مثالي للوكلاء الصوتيين الذين يحتاجون إلى التحليل والاستنتاج المعقد.
كما فعل التعلم المعزز مع نماذج التعرف على الصوت (ASR)، فإنه يتبع المسار نفسه هنا. يستعمل F5R-TTS خوارزمية GRPO مع نظام مكافأة مزدوج لتقليل الأخطاء وزيادة تشابه الصوت، مما يرفع دقة النطق وجودة الاستنساخ معاً.
أعلى تصنيف ELO ضمن قائمة المتصدرين للنماذج المتاحة. تقنية الاستنساخ الصوتي مضمّنة ضمن السعر الأساسي — بخلاف ElevenLabs التي تفرض رسوماً إضافية. تم تصميم إصدار Mini للألعاب في الوقت الفعلي بزمن استجابة أقل من 130ms.
أرخص نموذج متواجد ضمن العشرة الأوائل. مخصص للفرق التي تحتاج إلى إنتاج كميات هائلة من الصوتيات بميزانيات محدودة — يقدم أقل سعر مقابل جودة ملائمة.
في 26 مارس 2026، تم إطلاق Voxtral TTS من Mistral و Transcribe من Cohere و CoVo-Audio من Tencent خلال ساعات معدودة. علّق أحد مستخدمي Reddit قائلاً: “The on-prem voice stack is here.” — كانت هذه الجملة خير تلخيص لذلك اليوم.
المقارنة الكمية — MOS، ELO، وزمن الانتقال (Latency)
يختلف تقييم TTS جذرياً عن التعرف على الكلام (STT). المقياس الرئيسي هنا هو MOS (متوسط رأي المستخدمين) — تقييم بشري وليس حساباً رياضياً جافاً. تستخدم لوحة الصدارة TTS Arena Leaderboard وأيضاً منصة Artificial Analysis نظام ELO المبني على الاختبار الأعمى:
| النموذج | تقييم ELO / MOS | زمن الانتقال (Latency) | استنساخ الصوت | النوع | السعر التقريبي |
|---|---|---|---|---|---|
| Inworld TTS MAX 2026 | ELO 1594 | — | مجاني (مضمن) | تجاري | متوسط |
| ElevenLabs v3 | في القمة | 75–150ms | تكلفة إضافية | تجاري | $5–$1300/شهرياً |
| Chatterbox Turbo 2026 | 65.3% أفضلية | <150ms | مجاني (MIT) | مفتوح (MIT) | مجاني |
| Voxtral TTS 2026 | 62.8% أفضلية | — | خالي اللقطة (Zero-shot) | مفتوح الأوزان | ~1/5 من سعر ElevenLabs |
| Cartesia Sonic 3.5 2026 | مؤقتاً #1 (AA) | 40ms (Turbo) | محدود | تجاري | متوسط |
| Fish Speech V1.5 | ELO 1339 | — | خالي اللقطة | CC-BY-NC | مجاني (غير تجاري) |
| CosyVoice2-0.5B | جيد | 150ms للبث | خالي اللقطة | مفتوح (Apache 2) | مجاني |
| Kokoro (82M) | ممتاز مقارنة بحجمه | 96× الزمن الفعلي | لا يوجد | مفتوح (Apache 2) | مجاني |
| Speechify SIMBA 3.0 2026 | ELO ~1159 | — | محدود | تجاري | $10 لكل مليون حرف |
يعتمد تقييما ELO و MOS بشدة على بيانات الاختبار وعلى تركيبة المقيّمين. قد يتألق نموذجٌ ما في قراءة الكتب الصوتية ويفشل كوكيل صوتي لخدمة العملاء. يجب دائماً اختبار النماذج بناءً على احتياجاتك الفعلية ومع مستمعين حقيقيين.
استنساخ الصوت (Voice Cloning) في 2026 — الوضع الراهن
أصبح استنساخ الصوت (توليد صوت شخص محدد بناءً على بضع ثوانٍ من صوته) ميزة عامة وشائعة في عام 2026. ومع هذه القوة، برزت تحديات كبرى:
تقوم نماذج مثل Chatterbox، و Fish Speech، و CosyVoice2 باستنساخ الصوت باستخدام عينة من 3 إلى 10 ثوانٍ فقط، دون حاجة للضبط الدقيق (Fine-tuning).
يمكن استنساخ صوت شخص ناطق بالفارسية وجعله يتحدث الإنجليزية أو اليابانية بدون لكنة فارسية. هذه ثورة كبرى في عالم الدبلجة الدولية.
تمتلك كل من Resemble AI و ElevenLabs وجوجل أنظمة للعلامات المائية الصوتية المخفية، وأصبح اكتشاف التزييف العميق (Deepfake) حقلاً بحثياً مستقلاً.
فرض الاتحاد الأوروبي وعدة ولايات أمريكية قوانين مقيدة، وبات استنساخ الصوت دون موافقة صاحبه محظوراً على معظم المنصات.
تمتلك النماذج الحديثة القدرة على فصل هوية المتحدث عن المشاعر؛ بحيث يتم توليد الصوت بحالة حزن أو فرح دون المساس ببصمة الصوت الأساسية.
يتطلب الإصدار الاحترافي من ElevenLabs نحو 30 دقيقة من التسجيلات عالية الجودة للوصول إلى جودة إنتاج متفوقة بوضوح على أنظمة (Zero-shot).
لماذا يعتبر TTS للغة الفارسية مسألة فريدة؟
تختلف التحديات التي يواجهها تحويل النص إلى كلام (TTS) باللغة الفارسية عن تحديات التعرف على الصوت (STT)، بل إنها أصعب من نواحٍ كثيرة، لأن الأول يتطلب بيانات بالغة النقاء:
تُكتب الفارسية يومياً بدون علامات التشكيل، فهل الكلمة “مَدرسه” أم “مُدَرِّس”؟ ينبغي على النموذج الاستنتاج من السياق، فأي خطأ في النطق يفسد طبيعية الصوت المخرَج.
يجب نطق الأرقام والتواريخ والوحدات والاختصارات والرموز التعبيرية بطريقة صحيحة. واجهة (Frontend) الـ TTS في الفارسية أكثر تعقيداً مقارنة بالإنجليزية.
البيانات هنا يجب أن تكون أنقى من بيانات ASR: بلا ضجيج، نطق سليم تماماً، وبمعدل عينات مرتفع. قدمت مشاريع مثل ManaTTS و ParsVoice تقدماً ولكن ما زال غير كافٍ.
يختلف نمط التشديد والنبر في الفارسية كلياً عن الإنجليزية. أي نموذج مدرب على الإنجليزية سينتج نبرات غير طبيعية عند التوليد بالفارسية.
الفارسية المتداولة مليئة بالكلمات الإنجليزية والفرنسية والعربية، وكل منها يمتلك قاعدة نطق مختلفة. يجب أن يدرك النموذج متى ينطق “Software” بطابع فارسي ومتى بالإنجليزية.
معظم قواعد البيانات الصوتية الفارسية مقتصرة على متحدث واحد أو قلة من المتحدثين، مما يعيق جودة استنساخ الأصوات (Voice Cloning).
وصل أفضل نموذج مفتوح المصدر لـ TTS الفارسي (المعتمد على Tacotron2 + ManaTTS) إلى تقييم MOS يقارب 3.76 — وذلك بالمقارنة مع أكثر من 4.5 الذي تدعيه ElevenLabs للإنجليزية. تشير هذه الفجوة إلى أن الـ TTS الفارسي الفائق الجودة لا يزال معضلة تنتظر حلاً.
حالة TTS الفارسي في 2026
| النموذج / المنهجية | النوع | الحالة | ملاحظة |
|---|---|---|---|
| Chatterbox بضبط دقيق للفارسية 2025 | مفتوح المصدر + مجتمع المطورين | متوفر (HuggingFace) | متوفر بضبط دقيق من قِبل المجتمع. الجودة مقبولة للاستخدام العام ولكنها ليست بدرجة احترافية للإنتاج التجاري. |
| Tacotron2 + ManaTTS | مفتوح المصدر مُخصص | أفضل مفتوح مصدر | يحتوي ManaTTS على 114 ساعة من الأصوات عالية الجودة لمتحدث واحد. هو الأساس الأفضل لـ TTS الفارسي بتقييم MOS 3.76. |
| نموذج VITS الفارسي (ZabanZad.ai) | مفتوح المصدر | في إطار البحث | مشروع لمختبر SAIL بهدف إنتاج TTS فارسي بجودة تجارية، وما يزال قيد التطوير. |
| ParsVoice (متعدد المتحدثين) 2025 | قاعدة بيانات | تم النشر | أول قاعدة بيانات كبرى متعددة المتحدثين للفارسية مستخرجة من IranSeda، وتمثل أساساً لتدريب النماذج المتعددة الأصوات. |
| XTTS v2 + ضبط دقيق للفارسية | مفتوح المصدر + مخصص | يحتاج للعمل | يمكن ضبطه من خلال 6 دقائق من المقاطع الصوتية، لكن واجهة توحيد النص الفارسية تحتاج لتطوير مستقل. |
| الخدمات التجارية الإيرانية | تجاري | محدودة | تتواجد بعض النماذج الفارسية ضمن شركات مثل “بلد”، ولكنها ليست مفتوحة للعامة وتتفاوت في الجودة. |
توصية عملية لتقنية TTS باللغة الفارسية
- على المدى القصير: استخدام XTTS v2 أو Chatterbox مع ضبط دقيق (Fine-tuning) باستخدام قاعدة بيانات مخصصة لك (تحتوي على الأقل 30 دقيقة من الصوت المُنقّى والموسوم).
- الواجهة الأمامية (Frontend) هي الأهم: بناء وحدة قوية لتوحيد النصوص (Text Normalization) تتعامل بدقة مع الأرقام والتواريخ والاختصارات والكلمات الإنجليزية يعتبر أكثر أهمية من اختيار النموذج بحد ذاته.
- تحويل الحروف إلى مقاطع صوتية (G2P): ضرورة وجود نظام G2P فارسي دقيق للنماذج التي تعتمد على المقاطع الصوتية (Phonemes)، خاصة لترجمة الكلمات العربية والإنجليزية داخل النص الفارسي.
- على المدى المتوسط: الاعتماد على ParsVoice للتدريب على تعدد الأصوات، حيث تُساهم هذه البيانات في تحسين قدرات استنساخ الصوت بشكل ملحوظ.
- على المدى الطويل: الضبط الدقيق لنموذج Voxtral TTS (عندما يدعم الفارسية بشكل واسع) باستخدام بيانات متخصصة بالمجال المطلوب للحصول على أعلى جودة ممكنة.
نموذج TTS فارسي بصوت طبيعي ومتعدد المتحدثين وقابل للاستنساخ وبتقييم MOS يفوق 4 — هو شيء غير موجود حتى الآن. أي فريق يتمكن من بناء هذه التقنية وتوفيرها كواجهة برمجية (API) سيسيطر على أسواق إيران وأفغانستان وطاجيكستان. والخطوة الأولى هي إعداد قاعدة بيانات نقية ومتعددة المتحدثين.
المسار المستقبلي لتقنية TTS — إلى أين نتجه؟
تماماً كما أحدث Qwen3-ASR ثورة في التعرف على الصوت باستخدام GSPO-RL، أثبتت نماذج مثل F5R-TTS و GLM-TTS أن خوارزمية GRPO تستطيع تحسين وضوح الكلمات وتشابه الصوت في وقت واحد. في عام 2027 ستستخدم معظم النماذج الرائدة التعلم المعزز.
رسم GPT-Realtime-2 المسار: الاستغناء عن التسلسل (STT → LLM → TTS) لصالح نموذج متكامل يفهم الصوت مباشرة ويرد بصوت، مما يقلص زمن الاستجابة من 800ms إلى أقل من 300ms ويحسّن جودة المحادثات جذرياً.
بدأت ElevenLabs v3 باستخدام العلامات الصوتية (audio tags)، ولكن المستقبل يتجه إلى نماذج تستنتج هذه الحالات تلقائياً من سياق النص؛ ليدرك النموذج بمفرده أن “هذه الجملة يجب أن تُقال بتردد” بدلاً من إدراج المطور لعلامة برمجية.
مع 82 مليون معلمة، يقدم Kokoro جودة تجارية ممتازة. التوجه الحالي يسير نحو نماذج تعمل على الهواتف الذكية في الوقت الفعلي؛ مما يمنح الأولوية للخصوصية، والاستخدام دون اتصال، وللأسواق ذات الإنترنت المحدود.
يتيح الجمع بين الاستنساخ الصوتي الفوري (Zero-shot) والضبط الدقيق بالتعلم المعزز إمكانية امتلاك ملف صوتي شخصي لكل مستخدم. سيتحدث مساعدك الذكي بصوتك الخاص — أو بصوت مصمم بالكامل حسب رغبتك الشخصية.
التطبيقات الصناعية لـ TTS
أعلى جودة ومشاعر: ElevenLabs v3 · أقل زمن استجابة (40ms): Cartesia Sonic Turbo · أفضل نموذج مفتوح باختبار أعمى: Chatterbox Turbo · مفتوح المصدر متعدد اللغات: Fish Speech V1.5 · للعمليات الطرفية والمحلية: Kokoro 82M · للبث المباشر المفتوح: CosyVoice2-0.5B · للدبلجة: IndexTTS-2 · للغة الفارسية: Tacotron2 + ManaTTS + وحدة معالجة النصوص (Normalization) مخصصة
خلاصة القول
لقد دخلت تقنية TTS في عام 2026 مرحلة لم يعد فيها الأداء “الجيد” كافياً. فحين يتفوق نموذج Chatterbox Turbo مفتوح المصدر (برخصة MIT) على منصة ElevenLabs الرائدة، فهذا يعني أن أي فريق بحثي يتمتع بموارد مناسبة قادر على تطوير نموذج ينافس كبرى الشركات.
إليك 3 نقاط رئيسية تخص الفِرق العاملة في هذا المجال:
- البنية التي تجمع بين AR و Flow Matching و RL هي المستقبل: النماذج التي تمزج هذه العناصر الثلاثة معاً — مثل Voxtral — ستقدم التوازن الأمثل بين الجودة، السرعة، وقابلية التحكم. ستصبح هذه البنية هي المعيار المتبع خلال العامين المقبلين.
- في اللغة الفارسية، الواجهة الأمامية (Frontend) تتفوق في أهميتها على النموذج: بناء نظام متين لتوحيد النصوص (Normalization) — قادر على تحويل الأرقام، التواريخ، والمصطلحات الأجنبية بدقة — له أثر إيجابي أكبر بكثير من اختيار أحدث النماذج العصبية.
- النقص في قواعد البيانات الفارسية المتعددة المتحدثين هو العائق الأكبر: شكلت ParsVoice خطوة نوعية كبرى، لكننا بحاجة لمزيد من قواعد البيانات الضخمة التي تغطي مجالات أوسع ونبرات أكثر تنوعاً. الفريق الذي سيوفر تلك البيانات، سيكون هو الرابح الأول في سوق الـ TTS للغة الفارسية.