حجم الخط + -
2 دقائق للقراءة

خطت «غوغل» مرحلة جديدة في تطوير تقنيات تحويل النص إلى كلام عبر نماذج «جيميناي»، بإضافة قدرات صوتية تتيح إنتاج أداء أكثر واقعية للنصوص، مع إمكانية التحكم في النبرة واللهجة وسرعة الحديث والإيقاع والمشاعر، فضلاً عن محاكاة الهمس والضحك والتنهدات والتوقفات أثناء الكلام.

وتأتي هذه التطورات ضمن توسيع عائلة Gemini 3.8، التي انطلقت مع نموذج Gemini 3.8 Flash، قبل أن تنضم إليها نماذج Live وLive Extended Thinking، وصولاً إلى نموذجي تحويل النص إلى كلام Gemini 3.8 Flash TTS وFlash-Lite TTS.

ويمنح التحديث المستخدمين إمكانات واسعة في تصميم الأصوات، إذ يستطيع Gemini 3.8 Flash TTS إنشاء صوت أصلي انطلاقاً من وصف مكتوب باللغة الطبيعية، مع دعم أكثر من 100 لغة ولهجة.

كما توفر «غوغل» أكثر من 2000 صوت جاهز للاستخدام في الإنتاج، إلى جانب إمكانية استنساخ صوت بالاعتماد على عينة صوتية مدتها 30 ثانية، شريطة الحصول على الإذن اللازم لاستخدام الصوت، وفق ما أورده موقع «Android Authority».

ولا تقتصر التقنية على قراءة النصوص، بل تسمح بإعطاء تعليمات دقيقة سطراً بسطر لتحديد طريقة الأداء، بما يشمل النبرة وسرعة الكلام واللهجة والهمس والضحك والتنهدات وغيرها من المؤثرات الحوارية.

كما يمكن للنظام تحويل نص واحد إلى حوار بين شخصين، مع الحفاظ على استقرار أصوات الشخصيات حتى في تسجيلات تمتد لساعات.

وتفتح هذه الإمكانات المجال أمام استخدامات متعددة، من بينها إنتاج البودكاست والكتب الصوتية والدبلجة والوكلاء الصوتيين ومقاطع الفيديو المروية، بما يقلل من الطابع الآلي الذي يميز عدداً من الأصوات التي تنتجها تقنيات الذكاء الاصطناعي.

وأظهرت الاختبارات التي استندت إليها «غوغل» نتائج قوية للنماذج الجديدة. فقد تصدر Gemini 3.8 Flash TTS الترتيب العام في اختبار Voice Design Benchmark التابع لشركة Hume AI،

وسجل 60.8 نقطة في فئة اللهجات، فيما احتل نموذجا Flash وFlash-Lite المركزين الأول والثاني في مؤشر الجودة العام لدى Hume. كما أظهرت اختبارات Voice Arena نتائج وضعت النموذجين في الصدارة أو بالقرب منها في عدد من اللغات.

وفي المقابل، لم تتفوق نماذج «غوغل» في جميع الاختبارات، إذ حققت ElevenLabs نتائج أعلى في اختبارات Hume المتعلقة بجودة الصوت الفردي والتنوع الشبيه بالأصوات البشرية.

ولا تقتصر إتاحة هذه القدرات على أدوات المطورين، حيث بدأت «غوغل» دمج Flash TTS في تطبيق Gemini Notebook، بينما وصل Flash-Lite TTS إلى خدمة Google Vids، بالتزامن مع توسيع إتاحة أحدث مولد فيديو Omni في Google Vids. ويمكن للمطورين الوصول إلى النموذجين عبر Gemini API وAI Studio.

وفي ظل المخاطر المرتبطة بإساءة استخدام استنساخ الأصوات، وضعت «غوغل» مجموعة من إجراءات الحماية، من بينها اشتراط التحقق من موافقة صاحب الصوت قبل استنساخه، وإضافة تقنية SynthID للعلامات المائية، إلى جانب بيانات اعتماد C2PA للمساعدة في تحديد المحتوى المولد بالذكاء الاصطناعي.

كما حظرت الشركة ميزة استنساخ الأصوات داخل AI Studio في عدد من المناطق، تشمل المملكة المتحدة والمنطقة الاقتصادية الأوروبية والهند وولايتي تكساس وإلينوي، لتواصل بذلك تطوير أدوات صوتية تمنح المستخدم تحكماً أكبر في الأداء مع وضع قيود على بعض الاستخدامات الحساسة.