تحويل الكلام إلى نص (STT / ASR)
في عالم اليوم
من HMM إلى نماذج SALM الهجينة؛ مراجعة شاملة للبنى، أفضل نماذج 2025-2026، التحديات الفارسية (والعربية)، ومستقبل هذه التقنية.
ما هو STT ولماذا هو مهم؟
تحويل الكلام إلى نص أو ASR (التعرف الآلي على الكلام) هي التقنية التي تحول الصوت البشري المنطوق إلى نص مكتوب. ما يبدو بسيطاً هو خادع — فخلف كل كلمة يتم نسخها عقود من البحث في معالجة الإشارات، اللغويات، والتعلم العميق.
يسير السوق العالمي لهذه التقنية في مسار نمو غير مسبوق وسيصل إلى 53 مليار دولار بحلول عام 2030. الدافع الرئيسي لهذا النمو هو ثورة النماذج اللغوية الكبيرة وظهور البنى الهجينة LALM (نموذج اللغة والصوت الكبير) التي لم تعد تنسخ فقط — بل “تفهم”.
حتى عام 2022، كانت نماذج ASR “تتعرف على الأنماط”. منذ عام 2023 فصاعداً، النماذج الجديدة LALM “تفهم” — إنها تفهم الصوت، ولا تكتفي بنسخه. هذا الاختلاف الجوهري في البنية، وليس مجرد زيادة الدقة، هو الأساس.
تطور بنى STT
لفهم أين تقف نماذج اليوم، يجب أن نعرف من أين أتينا:
نماذج ماركوف المخفية مع الخليط الغاوسي. كان النظام يتطلب ثلاثة مكونات مستقلة: النموذج الصوتي، نموذج النطق، والنموذج اللغوي. كانت الدقة المنخفضة، والحاجة إلى خبراء، والهشاشة أمام الضوضاء هي المشاكل الرئيسية.
GMM · HMM · N-gram LMاستبدال GMM بـ DNN كان قفزة هائلة. لاحقاً، دخلت RNN و LSTM لنمذجة التسلسلات الزمنية. كانت هذه البنى لا تزال تتطلب مساراً متعدد المراحل (pipeline).
DNN · LSTM · RNN · CTCغيّر Conformer (دمج المحول + الطي) كل شيء. نماذج End-to-End مثل wav2vec 2.0 و Whisper انتقلت مباشرة من الموجة الصوتية إلى النص. تم تدريبها على مئات الآلاف من الساعات من البيانات بأداء غير مسبوق.
Transformer · Conformer · wav2vec · Whisperبنية SALM (نموذج اللغة المعزز بالصوت) الهجينة. مشفر صوتي قوي (مثل FastConformer) متصل مباشرة بـ LLM. النماذج لا تنسخ فقط — بل تلخص وتجيب على الأسئلة. كان NVIDIA Canary-Qwen أول مثال مفتوح المصدر.
FastConformer · SALM · Multimodal ASRجيل جديد كلياً: نموذج اللغة والصوت الكبير (LALM). تستخدم نماذج مثل Qwen3-ASR نموذج Qwen3-Omni كأساس وتم تحسينها بواسطة التعلم المعزز (RL). النتيجة: مقاومة استثنائية للضوضاء، الغناء، اللهجات، والأنماط النصية المعقدة. يتبع Voxtral من Mistral نفس المسار ببنية 4B للبث المباشر (streaming).
LALM · Qwen3-Omni · AuT · GSPO-RL · Streaming 4Bأفضل نماذج 2025 — أسس الجيل الجديد
أصبحت هذه النماذج معيار الصناعة في 2025 ولا تزال الخيار الصحيح للعديد من الاستخدامات:
أول SALM مفتوح المصدر. مشفر FastConformer + فاك تشفير Qwen3-1.7B. قادر على النسخ، التلخيص، والإجابة على الأسئلة. تصدر قائمة Open ASR Leaderboard حتى أواخر 2025 — الآن أخذ Qwen3-ASR مكانه.
أفضل إنتاجية بين جميع النماذج المتاحة. دُرب على 36,000 ساعة من الصوت (بما في ذلك الصمت والضوضاء). مناسب للتعليق الصوتي الفوري ومراكز الاتصال. تم إطلاق Parakeet V3 (2026) بدعم لـ 25 لغة.
مشفر البث المباشر Ergodic لزمن انتقال منخفض جداً. نافذة ديناميكية بدلاً من كتلة 30 ثانية الثابتة لـ Whisper. استهلاك أقل للطاقة، مثالي للهواتف المحمولة وإنترنت الأشياء (IoT). نافس الفريق المكون من 6 أفراد شركات مثل NVIDIA و OpenAI.
نظام بيئي واسع، وثائق وفيرة، وأسهل في الإعداد. لا يزال الخيار الأفضل للمشاريع العامة متعددة اللغات. أطلقت OpenAI أيضاً نماذج GPT-4o-Transcribe و GPT-4o-mini-Transcribe في مارس 2025.
نماذج 2026 الجديدة جديد
من أواخر 2025 حتى أوائل 2026، جاءت موجة جديدة من النماذج التي غيرت المنافسة تماماً. هذه هي النماذج التي يجب أن تعرفها الآن:
المتصدر الحالي لقائمة Open ASR Leaderboard بين النماذج مفتوحة المصدر. دُرب بناءً على Qwen3-Omni وتم تحسينه بواسطة التعلم المعزز (GSPO). ميزة فريدة: يمكنه أيضاً نسخ الغناء والموسيقى. إصدار 0.6B للنشر الطرفي، بمتوسط زمن 92ms لأول رمز (TTFT). يأتي مع Qwen3-ForcedAligner-0.6B للحصول على طوابع زمنية دقيقة.
نموذج 4B للبث المباشر من Mistral. إصداران: Mini Transcribe V2 (دفعات) و Realtime (بث مباشر). يدعم تمييز المتحدثين، الانحياز السياقي، والطوابع الزمنية على مستوى الكلمة. يُزعم أنه يتفوق على GPT-4o mini Transcribe و Gemini 2.5 Flash و Deepgram Nova — وبسعر يقارب خُمس سعر ElevenLabs Scribe.
أول نموذج يتصدر في وقت واحد في AA-WER وزمن الانتقال. 2.3% WER على المعايير المستقلة — أدنى رقم متاح. هو الخيار الأول للوكلاء الصوتيين في المؤسسات، ولكنه الخيار الأغلى أيضاً.
المتصدر العام في Hugging Face Open ASR Leaderboard (بما في ذلك التجاري). مبني على Universal-2، الذي أُطلق في أغسطس 2025 بدعم لـ 99 لغة وميزات مضمنة للمشاعر/الكيانات/تمييز المتحدثين. واجهة برمجة تطبيقات (API) موحدة للوكيل الصوتي تجمع STT+LLM+TTS عبر WebSocket واحد.
نموذج STT المخصص من مايكروسوفت. 3.0% AA-WER بتغطية 140+ لغة — الخيار الأفضل للمؤسسات المدمجة في Azure. منافس مباشر لـ Google Chirp 3 المتاح أيضاً في المعاينة العامة.
الخيار الأرخص ذو الجودة العالية في السوق. للنسخ بكميات كبيرة وميزانية محدودة. إذا كنت تحتاج فقط إلى اللغات المدعومة ولا تحتاج إلى المعالجة في الوقت الفعلي، فهو يوفر أفضل عائد على الاستثمار (ROI).
لم تعد المنافسة في عام 2026 تقتصر على WER فقط. يُظهر Deepgram Nova-3 بزمن انتقال أقل من 300ms و Qwen3-ASR بإتقانه لعدة لغات ولهجات في آن واحد، أن “أفضل نموذج” يعتمد كلياً على حالة الاستخدام الخاصة بك.
جدول المقارنة الكمية للنماذج (2025–2026)
الأرقام التالية تستند إلى Hugging Face Open ASR Leaderboard و AA-WER v2.0 (Artificial Analysis) والتقارير الفنية الرسمية حتى يونيو 2026:
| النموذج | WER / AA-WER | RTFx / زمن الاستجابة | اللغة | البث المباشر | النوع |
|---|---|---|---|---|---|
| ElevenLabs Scribe v2 2026 | ~150ms | متعدد اللغات | نعم | تجاري | |
| Voxtral Small 2026 | <200ms | 13 لغة | نعم | مفتوح الوزن | |
| Azure MAI-Transcribe-1 2026 | ~140ms | 140+ | نعم | تجاري | |
| AssemblyAI Universal-3 Pro 2026 | ~150ms | 99+ | نعم | تجاري | |
| Qwen3-ASR-1.7B 2026 | 92ms (0.6B) | 52 لغة | نعم | مفتوح (Apache 2) | |
| Canary-Qwen 2.5B | ×418 | يركز على الإنجليزية | محدود | مفتوح (Apache 2) | |
| Parakeet TDT 1.1B | >2000x | الإنجليزية | نعم | مفتوح (Apache 2) | |
| Whisper Large V3 Turbo | أسرع بـ 6x | 99+ | جزئي | مفتوح (MIT) | |
| Moonshine v2 | منخفض جداً | الإنجليزية | نعم | مفتوح (MIT) |
AA-WER v2.0 و WER العادي ليسا متطابقين. يتم قياس AA-WER على بيانات أكثر تنوعاً (VoxPopuli، Earnings-22، AMI-SDM، AgentTalk) وعادة ما يكون أعلى من WER الرسمي للنموذج. قم دائماً بإجراء المقارنات على بياناتك الخاصة.
لماذا يعتبر STT الفارسي مشكلة فريدة؟
تعتبر الفارسية من أكثر اللغات تحدياً في معالجة الكلام. المشكلة ليست فقط نقص البيانات — فالبنية اللغوية للفارسية أكثر تعقيداً بطبيعتها:
الأبجدية الفارسية تُكتب من اليمين لليسار، وتتخذ الحروف أشكالاً مختلفة في مواضع مختلفة. يجب أن تأخذ محركات STT هذا بعين الاعتبار في تسوية النص (Normalization).
من الطهرانية إلى الأصفهانية والشيرازية والمشهدية — لكل لهجة نطق مختلف. وتضيف الفارسية الأفغانية (الدرية) والطاجيكية تحديات إضافية.
تحتوي الفارسية على العديد من الكلمات المركبة التي تُكتب أحياناً متصلة وأحياناً منفصلة: “امیررضا” أو “امیر رضا” — مشكلة كلاسيكية في التجزئة (Segmentation).
تُكتب الفارسية بالأرقام الفارسية والعربية على حد سواء. وهناك العديد من المصطلحات العربية في النص التي يختلف نطقها وكتابتها.
مجموعة Common Voice الفارسية أصغر بمئات المرات من الإنجليزية. العديد من مجموعات البيانات المتاحة تحتوي على ضوضاء عالية — يُبلغ عن WER الخاص بـ Google على Common Voice الفارسي بنسبة 25.2٪.
تتعامل معظم التطبيقات التجارية لـ STT الفارسي مع صوت هاتفي بتردد 8kHz، مما يضيف تحديات الحد من الضوضاء ويزيد من خطأ النماذج العامة.
يبلغ معدل الخطأ (WER) لمحرك Google STT على مجموعة Common Voice الفارسية 25.2%، ويسجل Whisper نسبة 31.75%. تُظهر هذه الأرقام أن النماذج العامة تتطلب بشكل قاطع ضبطاً دقيقاً (Fine-tuning) مخصصاً للغة الفارسية.
حالة نماذج STT للغة الفارسية
ينمو النظام البيئي لـ STT الفارسي. النماذج والمقاربات الرئيسية المتاحة:
| النموذج / المقاربة | النوع | الحالة | ملاحظة مهمة |
|---|---|---|---|
| Qwen3-ASR + فارسي 2026 | مفتوح المصدر + مخصص | قيد المراجعة | يدعم 52 لغة — يتطلب اختباراً دقيقاً على الفارسية الحوارية. بنيته LALM واعدة في التعامل مع اللهجات والضوضاء. |
| Whisper + ضبط دقيق فارسي | مفتوح المصدر + مخصص | المقاربة الأكثر شيوعاً | الضبط الدقيق على Common Voice الفارسية ومجموعات البيانات الخاصة. أفضل توازن بين الدقة وسرعة التنفيذ لمعظم حالات الاستخدام. |
| Google STT (Chirp 3) 2026 | API تجاري | معاينة عامة | أحدث إصدار من Chirp مع مزيل ضوضاء مدمج وتمييز المتحدثين. أقل WER سحابي للفارسية ولكن قيود الوصول في إيران لا تزال قائمة. |
| wav2vec 2.0 + فارسي | مفتوح المصدر + مخصص | نشط في الأبحاث | إشراف ذاتي على الصوت الفارسي دون الحاجة للنسخ — جذاب للبيانات الوفيرة غير الموسومة. |
| Shenasa / HamTech ASR | إيراني | محدود | مجموعة بيانات مفتوحة المصدر مدتها 30 ساعة. نقطة انطلاق جيدة للبحث، ولكنها غير كافية للإنتاج. |
| Conformer مخصص للمجال | تجاري/مخصص | أفضل نتيجة | الشركات التي صممت نماذج مخصصة على بيانات محددة المجال (مراكز الاتصال، الطبية) تحقق أفضل أداء. |
المقاربة العملية المقترحة للفارسية
- الأساس: اختبر Whisper Large V3 Turbo، أو Qwen3-ASR-1.7B إذا كانت التعددية اللغوية مطلوبة
- الضبط الدقيق (Fine-tuning): ما لا يقل عن 100 ساعة من الصوت الموصوف الخاص بالمجال للحصول على نتائج مقبولة
- تسوية النص (Normalization): تعتبر طبقة المعالجة اللاحقة القوية ضرورية لتوحيد الأرقام، المصطلحات، والكلمات المركبة
- نموذج اللغة (Language Model): دمج LM فارسي لتحسين تماسك المخرجات — خاصة للأسماء الخاصة والمصطلحات المتخصصة
- المحاذاة القسرية (Forced Alignment): للحصول على طوابع زمنية دقيقة، استخدم Qwen3-ForcedAligner-0.6B — فهو يتفوق على WhisperX
لا يزال STT الفارسي بمعدل WER أقل من 10٪ على الصوت الحواري الحقيقي (وليس المعايير) فجوة حقيقية في السوق. الفريق الذي يبني أفضل مجموعة بيانات فارسية مخصصة للمجال — وليس بالضرورة أفضل نموذج — هو من سيكسب هذا السوق.
مسار المستقبل — إلى أين نتجه؟
أثبتت Qwen3-ASR و Voxtral أن الأساس القوي للنموذج + RL يتفوق على البنى المخصصة لـ ASR. بحلول عام 2026-2027، ستمتلك كل شركة كبرى نموذج LALM مخصص. المسارات متعددة المراحل القديمة لم تعد مبررة.
أثبت Nova-3 في 2025 أنه يمكن معالجة 10 لغات في وقت واحد دون توجيه. هذا مهم جداً للفارسية — فالمحادثة الفارسية اليومية مليئة بالكلمات الإنجليزية والعربية والمصطلحات التقنية التي يجب على النموذج نسخها بشكل صحيح.
وصل Moonshine v2 مع 245M معلمة إلى دقة Whisper Large. ويتميز Qwen3-ASR-0.6B بزمن TTFT يبلغ 92ms. المسار واضح: في السنتين القادمتين، سيعمل STT بجودة المؤسسات على كل هاتف ذكي — بدون الحاجة إلى السحابة.
لن يقدر الجيل القادم من النماذج النص فحسب، بل أيضاً المشاعر، والتوتر، وثقة المتحدث، وحتى الحالة الصحية. أظهر Qwen3-ASR-Flash بالفعل القدرة على نسخ الغناء مع الضوضاء الخلفية — التحليل شبه اللغوي هو الخطوة التالية.
تقوم كل من AssemblyAI و Azure و Google ببناء واجهات تسمح للشركات بضبط نماذج STT على بياناتها الخاصة دون الحاجة إلى فريق تعلم آلي. سيكون هذا فارقاً كبيراً لمقدمي خدمات B2B.
التطبيقات الصناعية لـ STT
أعلى دقة إجمالية: ElevenLabs Scribe v2 · أفضل نموذج متعدد اللغات مفتوح المصدر: Qwen3-ASR-1.7B · أسرع إنتاجية: Parakeet TDT · أرخص معالجة دفعات: Voxtral Mini · على الجهاز (On-device): Moonshine v2 أو Qwen3-ASR-0.6B · بيئة المؤسسات Azure: MAI-Transcribe-1 · فارسية متخصصة: Whisper مضبوط بدقة + LM فارسي
الخلاصة
من يناير إلى يونيو 2026، شهد سوق STT أربعة تحولات كبرى: جلب Qwen3-ASR بنية LALM+RL إلى المصادر المفتوحة، وأثبت Voxtral أن البث المباشر 4B يمكن أن ينافس النماذج الأكبر، وحسّن ElevenLabs Scribe v2 كلاً من WER وزمن الانتقال في نفس الوقت لأول مرة، ودخلت Microsoft المنافسة المباشرة مع MAI-Transcribe-1.
ثلاث نقاط رئيسية لأي فريق يعمل في هذا المجال:
- غيّر معايير الاختيار الخاصة بك: لم يعد معدل خطأ الكلمات (WER) هو المقياس الوحيد. AA-WER على بيانات متنوعة، وزمن انتقال البث، والقدرة على الضبط الدقيق، وتكلفة الاستدلال كلها أمور مهمة في الاختيار النهائي.
- بالنسبة للفارسية، البيانات أهم من النموذج: يدعم Qwen3-ASR حوالي 52 لغة ولكنه لا يزال يحتاج إلى ضبط دقيق مخصص للفارسية. الفريق الذي يبني أفضل مجموعة بيانات فارسية مخصصة للمجال — وليس بالضرورة أفضل نموذج — هو الفائز.
- LALM هو المستقبل — استعد الآن: المسارات متعددة المراحل القديمة أصبحت من الماضي. الاستثمار في البنى الموحدة ASR+LLM مبرر من الآن.