كتابة

مقارنة سريعة لنماذج TTS العربية


بسم الله الرحمن الرحيم

أثناء مراجعتي لنماذج الذكاء الصناعي الخاصة بمايكروسوفت MAI Models، قمت باختبار نموذج MAI-Voice-2-Flash لتحويل النص إلى صوت. النتيجة ليست سيئة، رغم أن اللغة العربية ليست مدرجة ضمن خيارات التحويل.

تذكرت أني قمت قبل عدة أعوام باختبار نماذج Gemini TTS فقررت أن أقوم بمقارنة سريعة لهذه النماذج مع منصة ElevenLabs المشهورة و Hakim باستخدام جملة قصيرة ومشاركة النتائج في مقال موجز .

النص العربي:

“يتنوعُ الأدبُ العربيُّ عبر عصوره الطويلةِ بين الشعر والنثر، ويشملُ نماذجَ خالدةً تعكسُ عبقريةَ اللسان العربي.”

مزود الخدمة اسم النموذج اسم الصوت النتيجة
Microsoft MAI-Voice-2-Flash Klaus Play
Microsoft MAI-Voice-2-Flash Bence Play
ElevenLabs Eleven-V3 Chaouki Play
ElevenLabs Eleven-V3 Hassan Mort Play
Hakim Hakim-Fast-V1 Ali Play
Hakim Hakim-Fast-V1 Amir Play
Google Gemini-3.8-Flash-TTS Algenib Play
Google Gemini-3.8-Flash-TTS Neno Play

بدأت أتساءل عن مصير من يعملون في مجال التسجيل الصوتي للكتب المسموعة، واسيت نفسي بأن نماذج الذكاء الصناعي ربما يمكنها نقل المحتوى ولكن ليس الإحساس الذي ينقله الصوت البشري.