أضافت شركة جوجل قدرات صوتية جديدة إلى نماذج جيميناي، تتيح للذكاء الاصطناعي إنتاج أصوات أكثر واقعية وتنفيذ النصوص بطريقة تقترب من الأداء التمثيلي، مع إمكانية التحكم في النبرة واللهجة وسرعة الحديث والمشاعر، إلى جانب التوقفات والهمسات والضحكات والتنهدات.
وتأتي القدرات الجديدة ضمن توسع جوجل في عائلة نماذج Gemini 3.8، التي تشمل نماذج Flash وLive وLive Extended Thinking، إلى جانب نماذج تحويل النص إلى كلام Gemini 3.8 Flash TTS وFlash-Lite TTS.
أكثر من 2000 صوت واستنساخ خلال 30 ثانية
يمنح Gemini 3.8 Flash TTS المستخدمين مستوى متقدمًا من التحكم في الأداء الصوتي، إذ يمكن للنظام إنشاء صوت جديد انطلاقًا من وصف مكتوب باللغة الطبيعية، مع دعم أكثر من 100 لغة ولهجة.
كما توفر جوجل أكثر من 2000 صوت جاهز للاستخدام في عمليات الإنتاج، فضلًا عن إمكانية استنساخ صوت متسق اعتمادًا على عينة صوتية مدتها 30 ثانية، شريطة امتلاك المستخدم الإذن اللازم لاستخدام الصوت.
ولا تقتصر التقنية على تقليد صوت الشخص، وإنما تتيح توجيه طريقة إلقاء النص بالتفصيل، بما في ذلك النبرة وسرعة الحديث واللهجة والهمس والضحك والتنهدات وغيرها من الإشارات الصوتية.
الذكاء الاصطناعي يقدم أداءً تمثيليًا
تتجاوز النماذج الجديدة مجرد تحويل الكلمات المكتوبة إلى ملف صوتي، إذ يمكنها تنفيذ تعليمات دقيقة سطرًا بسطر لتحديد كيفية نطق كل جملة وفقًا للسياق والمشهد.
ويمكن كذلك إنشاء حوارات بين شخصيتين انطلاقًا من نص واحد، مع الحفاظ على ثبات صوت كل شخصية عبر تسجيلات صوتية تمتد لساعات.
وتفتح هذه الإمكانات المجال أمام استخدامات متعددة، تشمل إنتاج البودكاست والكتب الصوتية والدبلجة والوكلاء الصوتيين ومقاطع الفيديو المروية، مع تقليل الطابع الآلي الذي ارتبط لفترة طويلة بالأصوات المولدة بواسطة الذكاء الاصطناعي.
نتائج متقدمة في اختبارات جودة الصوت
وأشارت نتائج الاختبارات التي أجرتها جوجل إلى أداء قوي للنماذج الجديدة في عدد من معايير تقييم الأصوات.
فقد تصدر Gemini 3.8 Flash TTS الترتيب العام في اختبار Voice Design Benchmark التابع لشركة Hume AI، وسجل 60.8 نقطة في فئة اللهجات.
كما احتل نموذجا Flash وFlash-Lite المركزين الأول والثاني في مؤشر الجودة العام لدى Hume، بينما أظهرت اختبارات Voice Arena نتائج وضعت النموذجين في الصدارة أو بالقرب منها عبر مجموعة من اللغات.
لكن النتائج لم تكن متفوقة في جميع الفئات، إذ سجلت شركة ElevenLabs نتائج أعلى في اختبارات Hume الخاصة بجودة الصوت الفردي ومدى التنوع الذي يحاكي الأصوات البشرية.
جيميناي Notebook وGoogle Vids يحصلان على التقنية
ولا تقتصر القدرات الجديدة على أدوات المطورين، إذ بدأت جوجل طرح Flash TTS داخل تطبيق Gemini Notebook، بينما يصل نموذج Flash-Lite TTS إلى خدمة Google Vids.
ويتزامن ذلك مع توسيع إتاحة أحدث مولد فيديو Omni داخل Google Vids أمام عدد أكبر من المستخدمين.
وبالنسبة إلى المطورين، يمكن الوصول إلى النموذجين الجديدين من خلال Gemini API وAI Studio، بما يسمح بدمج قدرات توليد الأصوات والتحكم فيها داخل تطبيقات وخدمات مختلفة.
جوجل تفرض قيودًا على استنساخ الأصوات
ومع زيادة قدرات الذكاء الاصطناعي على تقليد أصوات الأشخاص، وضعت جوجل مجموعة من إجراءات الحماية للحد من إساءة استخدام تقنية استنساخ الأصوات.
وتشترط الشركة التحقق من الحصول على موافقة صاحب الصوت قبل استخدامه في عملية الاستنساخ، كما تستخدم تقنية SynthID لإضافة علامات مائية، إلى جانب بيانات اعتماد C2PA للمساعدة في تحديد المحتوى الذي تم إنشاؤه بواسطة الذكاء الاصطناعي.
كما تفرض جوجل قيودًا جغرافية على ميزة استنساخ الأصوات داخل AI Studio، إذ لا تتوفر الميزة في عدد من المناطق، من بينها المملكة المتحدة والمنطقة الاقتصادية الأوروبية والهند، إضافة إلى ولايتي تكساس وإلينوي في الولايات المتحدة.
من قراءة النصوص إلى صناعة المشاهد
تعكس هذه التطورات تحول أدوات تحويل النص إلى كلام من مجرد تقنيات لقراءة المحتوى المكتوب إلى أنظمة أكثر قدرة على محاكاة الأداء الصوتي البشري.
فمع إمكانية تحديد النبرة واللهجة والإيقاع والمشاعر والتوقفات والهمسات والتنهدات، أصبح بإمكان الذكاء الاصطناعي التعامل مع النص باعتباره أداءً صوتيًا يحتاج إلى توجيه، وليس مجرد كلمات يتم تحويلها آليًا إلى صوت.
وبذلك تسعى جوجل إلى جعل جيميناي أداة قادرة ليس فقط على التحدث، وإنما على تقديم النص بطريقة أقرب إلى أداء الممثلين، مع الحفاظ على هوية الأصوات والتحكم في تفاصيل المشهد الصوتي.




