الذكاء الاصطناعي
Mistral AI تطلق Voxtral، وهو نموذج مفتوح المصدر لتحويل النص إلى كلام
أطلقت شركة Mistral AI نموذج Voxtral TTS، وهو نموذج مفتوح المصدر لتحويل النص إلى كلام يدعم تسع لغات، ويمكنه تكييف أصوات مخصصة باستخدام أقل من 5 ثوانٍ من الصوت.
يوم الخميس، أطلقت شركة الذكاء الاصطناعي الفرنسية Mistral AI نموذج Voxtral TTS، وهو نموذج جديد مفتوح المصدر لتحويل النص إلى كلام. صُمم النموذج لتحويل النص إلى صوت مسموع، مما يتيح للمؤسسات بناء وكلاء صوتيين لخدمة العملاء، والمبيعات، وحالات استخدام أخرى للتفاعل. يدعم Voxtral TTS تسع لغات، ويمكنه التكيف مع صوت مخصص باستخدام عينة صوتية مدتها أقل من 5 ثوانٍ. ووفقاً للشركة، فإن النموذج قادر على التقاط الخصائص الدقيقة للكلام البشري، بما في ذلك اللهجات، والتصريفات، والتنغيمات، وعدم انتظام التدفق. وتسمح هذه القدرة للنموذج بالتبديل بين اللغات بسهولة مع الحفاظ على الخصائص الفريدة للصوت الأصلي.
بُني النموذج على بنية Ministral 3B وهو مُحسّن للأداء في الوقت الفعلي. ويتميز بزمن وصول إلى أول صوت (TTFA) — الذي يقيس متى يبدأ النموذج في التحدث بعد تلقي المدخلات — يبلغ 90 مللي ثانية لعينة مدتها 10 ثوانٍ مكونة من 500 حرف. بالإضافة إلى ذلك، يتمتع Voxtral TTS بعامل وقت فعلي (RTF) — وهو مقياس لسرعة العرض بالنسبة لطول المقطع — يبلغ 6 أضعاف. وهذا يعني أن النموذج يمكنه عرض مقطع مدته 10 ثوانٍ في نحو 1.6 ثانية. تجعل سرعة العرض العالية هذه النموذج مناسباً للتطبيقات ذات زمن الوصول المنخفض مثل الدبلجة أو الترجمة الفورية دون أن يبدو الصوت آلياً.
أشار Pierre Stock، نائب رئيس العمليات العلمية في Mistral AI، إلى أن النموذج تم تطويره استجابة لطلب العملاء للحصول على نموذج كلام يمكن تشغيله على أجهزة الحافة (edge devices)، والتي تشمل أجهزة مثل الساعات الذكية، والهواتف الذكية، وأجهزة الكمبيوتر المحمولة. وقال Stock: “لقد كان عملاؤنا يطلبون نموذجاً للكلام. لذا قمنا ببناء نموذج كلام صغير الحجم يمكن أن يتناسب مع ساعة ذكية، أو هاتف ذكي، أو كمبيوتر محمول، أو غيرها من أجهزة الحافة. تكلفته جزء بسيط من أي شيء آخر في السوق، لكنه يقدم أداءً متطوراً”.
في حين أن الإصدار الحالي هو نموذج لتحويل النص إلى كلام، فإن لدى Mistral AI خططاً أوسع لتقنيتها الصوتية. وذكر Stock أن الشركة تخطط لامتلاك منصة متكاملة (end-to-end) يمكنها التعامل مع تدفقات متعددة الوسائط من المدخلات والمخرجات، بما في ذلك الصوت، والنص، والصور. ووفقاً لـ Stock، فإن الفائدة الأساسية لهذا النظام الوكيل المتكامل المخطط له هي أنه سيسمح للمستخدمين بالحصول على معلومات أكثر بكثير من خلال دعم الصوت كمدخل ومخرج في آن واحد.
لماذا يهم
يضع إطلاق Voxtral TTS شركة Mistral AI في موقع المنافس لمزودي الذكاء الاصطناعي الصوتي الراسخين مثل ElevenLabs، وDeepgram، وOpenAI. ومن خلال تقديم بديل مفتوح المصدر يمكن تشغيله على أجهزة مثل الساعات الذكية، والهواتف الذكية، وأجهزة الكمبيوتر المحمولة، توفر Mistral AI للمؤسسات خياراً قابلاً للتخصيص لبناء وكلاء صوتيين.