أطلق فريق Qwen التابع لشركة علي بابا نموذج الذكاء الاصطناعي الجديد Qwen3.8-LiveTranslate، المصمم لتقديم ترجمة فورية ومتزامنة للمحادثات والكلام المباشر، مع إمكانية الاستعانة بإطارات الفيديو لتحسين فهم السياق.
ويستطيع النموذج الاستماع إلى حديث المستخدم أثناء استمرار الكلام، ثم تقديم الترجمة في صورة نص وصوت في الوقت نفسه، بما يستهدف تقليل الفاصل الزمني بين الحديث الأصلي والترجمة.
نموذج ذكاء اصطناعي للترجمة الفورية
يعتمد Qwen3.8-LiveTranslate على آلية مصممة للتعامل مع المحادثات المباشرة بصورة متزامنة، بحيث يبدأ النموذج في ترجمة الكلام قبل انتهاء المتحدث من حديثه، بدلًا من انتظار اكتمال الجملة أو المحادثة بالكامل.
وتتيح هذه الآلية استخدام النموذج في الاجتماعات والمحادثات متعددة اللغات، إلى جانب سيناريوهات الترجمة المباشرة التي تتطلب استجابة سريعة.
تقنية جديدة لتقليل زمن الاستجابة
وبحسب تقرير نشره موقع MarkTechPost، يعتمد النموذج على بنية جديدة تحمل اسم Interleave، ساهمت في خفض متوسط زمن التأخير من 2.8 ثانية إلى 2.3 ثانية، بانخفاض يقارب 18%.
كما تتضمن التحسينات جوانب مرتبطة بأمانة الترجمة وسلاسة المخرجات واختصارها، مع إتاحة النموذج حاليًا عبر واجهة برمجية على منصتي Alibaba Cloud Model Studio وQwenCloud.
تمييز المتحدثين في المحادثات الجماعية
ويقدم Qwen3.8-LiveTranslate مجموعة من القدرات الجديدة، من بينها إمكانية تمييز المتحدثين في الوقت الفعلي خلال المحادثات التي تضم عدة أشخاص.
كما يحافظ النموذج على خصائص صوت كل متحدث من خلال تقنية الاستنساخ الصوتي، بما يسمح بإخراج ترجمة صوتية أكثر اتساقًا مع هوية المتحدثين أثناء المحادثة.
عرض النص الأصلي والترجمة معًا
يدعم النموذج أيضًا العرض المتزامن للنص الأصلي والترجمة، بما يتيح للمستخدم متابعة الكلام بلغته الأصلية إلى جانب النص المترجم.
وتشمل قدراته التعامل مع السياقات الطويلة وتقليل حالات الالتباس، بحيث يحافظ النموذج على اتساق الأسماء والمصطلحات التي تظهر في بداية المحادثة أو الاجتماع عند استخدامها مرة أخرى في الأجزاء اللاحقة.
يدعم 60 لغة بقدرات صوتية ونصية
يستطيع Qwen3.8-LiveTranslate فهم 60 لغة، فيما يدعم الإخراج بالصوت والنص لـ29 لغة، بينما توفر اللغات الـ31 الأخرى مخرجات نصية فقط.
وتشمل قائمة اللغات التي يدعمها الإخراج الصوتي العربية والصينية والإنجليزية والألمانية والفرنسية والإسبانية واليابانية والكورية والهندية، إلى جانب لغات أخرى.
تكلفة استخدام النموذج الجديد
وتبدأ الأسعار المعلنة في سنغافورة من 7.5 دولارات لكل مليون رمز صوتي مدخل، بينما تبلغ تكلفة الرموز الصوتية المخرجة نحو 30 دولارًا لكل مليون رمز.
وبحسب الأسعار المعلنة، تعادل تكلفة معالجة الكلام من حيث المدخلات والمخرجات نحو 1.54 دولار للساعة الواحدة من الحديث، وفق آلية احتساب الرموز المستخدمة في النموذج.




