بقلم : أنطون فرولوف
نائب الرئيس الأول، رئيس قسم تطوير الذكاء الاصطناعي العام في بنك سبيربنك
يُمكن لمستخدمي مساعد GigaChat الذكي الاستمتاع بنموذج GigaChat الصوتي المُحدّث، وهو نموذج لغوي متطور قادر على معالجة الملفات الصوتية والرسائل الصوتية دون الحاجة إلى تحويل الكلام إلى نص. وقد تم تدريب هذا النموذج على فهم النبرة الصوتية، كما تم تعزيز قدراته في معالجة البيانات الصوتية لتقديم أداء أفضل.
"يُعدّ الصوت الوسيلة الأكثر طبيعية للتفاعل مع التكنولوجيا، ولكنه في الوقت نفسه الأكثر تطلبًا، إذ أن أي خطأ في الكشف أو سوء فهم للمشاعر يُفقد المستخدم ثقته بالمساعد فورًا. لهذا السبب، نعتقد أن سوق مساعدي الذكاء الاصطناعي يزخر بإمكانيات هائلة للنمو في مجال الصوت. ومن خلال إتاحة الوصول المفتوح لهذه النماذج، نُقدّم للمطورين والباحثين أداةً فعّالة. تتنوع تطبيقات تقنية الصوت بشكل كبير، بدءًا من الترجمة الصوتية الفورية وصولًا إلى خدمات الأشخاص الذين يعانون من اضطرابات النطق، بينما تُتيح إمكانية إتقان لغات متعددة وسهولة تعلّم لغات أخرى فرصًا دولية لهذه النماذج."
مساعد الذكاء الاصطناعي بمزيد من التعاطف
يستطيع تطبيق GigaChat المُحدّث الكشف عن المشاعر الإيجابية أو السلبية للمستخدمين بناءً على نبرة الصوت وخصائصه وفروق النطق الدقيقة، ما يجعله أكثر دقة في ردوده. على سبيل المثال، سيتحدث بلطف أكبر مع المستخدم المُنزعج أو يعكس مزاج من يُشارك أخبارًا سارة.
يستطيع النموذج معالجة تسجيلات صوتية تصل مدتها إلى ثلاث ساعات والتنقل بينها. يمكنك الاستفسار عن الوقت المحدد لمناقشة موضوع معين، أو طلب ملخص لجزء معين، أو الحصول على ملخص للتسجيل كاملاً مع الطوابع الزمنية. كما يتميز الذكاء الاصطناعي بقدرته على التمييز بين المتحدثين المختلفين في التسجيل. ستكون هذه الميزات مفيدة لمراجعة الاجتماعات والمكالمات، والتنقل بين التسجيلات، وتدوين المحاضر.
يستطيع مساعد الذكاء الاصطناعي الآن تذكر المعلومات المهمة للمستخدمين مباشرةً في الحوار الصوتي، والاعتماد عليها في الجلسات اللاحقة. عند الطلبات اللاحقة، سيأخذ GigaChat رغباتك السابقة في الاعتبار. على سبيل المثال، سيخطط مسار رحلة بناءً على اهتماماتك. يتمتع المستخدم بتحكم كامل في هذه الوظيفة، ما يعني إمكانية عرض المعلومات المسجلة، أو تعديلها، أو تعطيل الذاكرة في أي وقت من إعدادات الملف الشخصي.
تُظهر الاختبارات الداخلية أن GigaChat Audio يتمتع بكفاءة عالية في فهم الاستفسارات الصوتية والاستجابة لها، تضاهي أفضل الحلول العالمية. وقد تأكد ذلك من خلال معيار Arena-Hard-Audio، حيث قارنت شبكات عصبية أخرى، دون معرفة مسبقة، استجابات نماذج مختلفة لنفس الأسئلة الصوتية. حقق GigaChat Audio نسبة نجاح بلغت 70%، وهي نسبة تقارب نسبة نجاح Gemini 3 Flash preview (77.5%) وتتفوق على Gemini 2.5 Pro (62%). أما فيما يتعلق بدقة التعرف على المشاعر، فقد بلغت دقة نموذج Sber 80%، متفوقًا على Qwen3-Omni-30B (70%) وKimi-Audio (62%).
بالإضافة إلى دمج نموذج الصوت في مساعد الذكاء الاصطناعي، قام الفريق بنشر GigaChat3.1-Audio-10B كمصدر مفتوح، وهو إصدار خفيف الوزن يتعرف على اللغة الروسية والإنجليزية ولغات أخرى. يمكن استخدامه لإنشاء حلول نسخ صوتي، ومدربين على النطق، وأدوات تقييم جودة التعليق الصوتي، ومترجمين صوتيين مدركين للسياق، وحلول تلخيص للتسجيلات الصوتية الطويلة.
كما نشر Sber أيضًا GigaAM Multilingual كمصدر مفتوح، وهي مجموعة من نماذج التعرف التلقائي على الكلام. يُعدّ GigaAM أول نموذج مفتوح المصدر في روسيا يدعم لغات متعددة، ويُقدّم حاليًا أفضل جودة للتعرف على الكلام باللغة الروسية. وفقًا للمعايير، يُسجّل GigaAM أخطاءً أقل من أقرب منافسيه بنسبة تتراوح بين 1.5 و2. يدعم النموذج اللغات الروسية والإنجليزية والقرغيزية والكازاخية والأوزبكية، وهو متوفر بنسختين: نسخة مُصغّرة تعمل على المعالجات القياسية، ونسخة متطورة بجودة تعرّف أعلى. يُمكن استخدام GigaAM في مراكز الاتصال والمساعدين الصوتيين، ونسخ الاجتماعات، والمقابلات، والبودكاست، وإدخال الصوت في التطبيقات، والترجمة التلقائية.
يتوفر النموذجان على منصتي GitVerse وHugging Face، وقد تم تدريبهما مسبقًا على العديد من اللغات، مما يُتيح ضبطهما بسرعة للغات إضافية، بما في ذلك لغات دول رابطة الدول المستقلة. لا يتطلب ذلك سوى بضع عشرات من ساعات التسجيلات الصوتية المُعلّمة. وقد قُبلت أوراق بحثية علمية حول النماذج الجديدة في مؤتمر Interspeech 2026، وهو مؤتمر دولي رائد في علوم وتكنولوجيا الكلام.








