كتابة
مقارنة سريعة لنماذج TTS العربية
بسم الله الرحمن الرحيم
أثناء مراجعتي لنماذج الذكاء الصناعي الخاصة بمايكروسوفت MAI Models، قمت باختبار نموذج MAI-Voice-2-Flash لتحويل النص إلى صوت. النتيجة ليست سيئة، رغم أن اللغة العربية ليست مدرجة ضمن خيارات التحويل.
تذكرت أني قمت قبل عدة أعوام باختبار نماذج Gemini TTS فقررت أن أقوم بمقارنة سريعة لهذه النماذج مع منصة ElevenLabs المشهورة و Hakim باستخدام جملة قصيرة ومشاركة النتائج في مقال موجز .
النص العربي:
“يتنوعُ الأدبُ العربيُّ عبر عصوره الطويلةِ بين الشعر والنثر، ويشملُ نماذجَ خالدةً تعكسُ عبقريةَ اللسان العربي.”
| مزود الخدمة | اسم النموذج | اسم الصوت | النتيجة |
|---|---|---|---|
| Microsoft | MAI-Voice-2-Flash | Klaus | Play |
| Microsoft | MAI-Voice-2-Flash | Bence | Play |
| ElevenLabs | Eleven-V3 | Chaouki | Play |
| ElevenLabs | Eleven-V3 | Hassan Mort | Play |
| Hakim | Hakim-Fast-V1 | Ali | Play |
| Hakim | Hakim-Fast-V1 | Amir | Play |
| Gemini-3.8-Flash-TTS | Algenib | Play | |
| Gemini-3.8-Flash-TTS | Neno | Play |
بدأت أتساءل عن مصير من يعملون في مجال التسجيل الصوتي للكتب المسموعة، واسيت نفسي بأن نماذج الذكاء الصناعي ربما يمكنها نقل المحتوى ولكن ليس الإحساس الذي ينقله الصوت البشري.