تتجه جوجل إلى جعل أصوات الذكاء الاصطناعي أكثر واقعية، بعدما أضافت إلى نماذج جيميناي قدرات جديدة تسمح باستنساخ الأصوات وتنفيذ النصوص بطريقة أقرب إلى الأداء التمثيلي، مع إمكانية التحكم في النبرة واللهجة وسرعة الحديث والإيقاع والمشاعر، وحتى التوقفات والتنهدات والهمسات والضحكات.
وتأتي هذه الخطوة ضمن توسع جوجل في عائلة Gemini 3.8، التي بدأت مع نموذج Gemini 3.8 Flash، قبل أن تضيف الشركة نماذج Live وLive Extended Thinking، ثم توسع قدرات تحويل النص إلى كلام من خلال Gemini 3.8 Flash TTS وFlash-Lite TTS.
ويقدم التحديث مستوى أكبر من التحكم في طريقة إخراج الصوت، إذ يستطيع Gemini 3.8 Flash TTS إنشاء صوت أصلي انطلاقا من وصف مكتوب باللغة الطبيعية، مع دعم أكثر من 100 لغة ولهجة، ما يمنح المستخدم مساحة أكبر لتحديد الطريقة التي يريد أن يبدو بها الصوت.
وتوفر جوجل أيضا أكثر من 2000 صوت جاهز للاستخدام في الإنتاج، إلى جانب إمكانية استنساخ صوت متسق اعتمادا على عينة صوتية مدتها 30 ثانية، بشرط امتلاك المستخدم الإذن اللازم لاستخدام الصوت.
ولا تتوقف القدرات الجديدة عند تحويل النص المكتوب إلى تسجيل صوتي، إذ يمكن للنموذج تنفيذ تعليمات دقيقة سطرا بسطر لتحديد النبرة وسرعة الكلام واللهجة والهمس والضحك والتنهدات وغيرها من التفاصيل التي تمنح الحوار طابعا أكثر واقعية.
كما يستطيع النظام إنشاء محادثات بين شخصين انطلاقا من نص واحد، مع الحفاظ على ثبات أصوات الشخصيات خلال تسجيلات صوتية يمكن أن تمتد لساعات، وهو ما يفتح المجال أمام استخدام هذه التقنية في البودكاست والكتب الصوتية والدبلجة والوكلاء الصوتيين ومقاطع الفيديو التي تعتمد على السرد.
وتسعى هذه القدرات إلى تقليل الطابع الآلي الذي لا يزال واضحا في كثير من الأصوات المولدة بالذكاء الاصطناعي، من خلال منح النظام قدرة أكبر على التعامل مع النص باعتباره أداء صوتيا وليس مجرد كلمات يتم قراءتها بصوت آلي.
وأظهرت الاختبارات التي أجرتها جوجل نتائج قوية للنماذج الجديدة، إذ تصدر Gemini 3.8 Flash TTS الترتيب العام في اختبار Voice Design Benchmark التابع لشركة Hume AI، وسجل 60.8 نقطة في فئة اللهجات.
كما احتل نموذجا Flash وFlash-Lite المركزين الأول والثاني في مؤشر الجودة العام لدى Hume، بينما أظهرت اختبارات Voice Arena نتائج وضعت النموذجين في الصدارة أو بالقرب منها عبر عدد من اللغات.
لكن النتائج لم تكن متفوقة في جميع الفئات، إذ سجلت ElevenLabs نتائج أعلى في اختبارات Hume الخاصة بجودة الصوت الفردي ومدى التنوع القريب من الأصوات البشرية، ما يظهر استمرار المنافسة في سوق الأصوات المولدة بالذكاء الاصطناعي.
ولا تقتصر هذه التقنية على أدوات المطورين، فقد بدأت جوجل طرح Flash TTS داخل تطبيق Gemini Notebook، بينما يصل Flash-Lite TTS إلى خدمة Google Vids، بالتزامن مع إتاحة أحدث مولد فيديو Omni في Google Vids لعدد أكبر من المستخدمين.
أما المطورون، فيمكنهم الوصول إلى النموذجين من خلال Gemini API وAI Studio، ما يتيح استخدام قدرات تحويل النص إلى كلام واستنساخ الأصوات ضمن تطبيقات وخدمات مختلفة.
وفي ظل المخاوف المرتبطة بإساءة استخدام تقنية استنساخ الأصوات، وضعت جوجل مجموعة من إجراءات الحماية، إذ تتطلب الشركة التحقق من الحصول على موافقة صاحب الصوت قبل استخدامه في عملية الاستنساخ.
كما تستخدم جوجل تقنية SynthID لإضافة علامات مائية، إلى جانب بيانات اعتماد C2PA التي تساعد في تحديد المحتوى الذي تم إنشاؤه بواسطة الذكاء الاصطناعي.
وتفرض الشركة أيضا قيودا جغرافية على ميزة استنساخ الأصوات داخل AI Studio، حيث تحظر استخدامها في عدد من المناطق، من بينها المملكة المتحدة والمنطقة الاقتصادية الأوروبية والهند وولاية تكساس وولاية إلينوي.
وبهذه القدرات تتحول تقنيات تحويل النص إلى كلام في جيميناي إلى ما هو أبعد من مجرد قراءة النصوص، إذ أصبح بإمكانها التعامل مع النبرة والمشاعر واللهجة والإيقاع والتوقفات وغيرها من التفاصيل التي تمنح الصوت طابعا أقرب إلى الأداء البشري، مع توفير مساحة أكبر للمستخدم للتحكم في الطريقة التي يتم بها تقديم كل جملة ومشهد.
.jpg)
إرسال تعليق