Главная | ОБЩЕСТВО | «Сбер» открывает разработчикам GigaChat Audio и GigaAM Multilingual — новые модели для работы с голосом

«Сбер» открывает разработчикам GigaChat Audio и GigaAM Multilingual — новые модели для работы с голосом

«Сбер» выложил в открытый доступ облегчённую версию модели GigaChat3.1-Audio-10B и семейство моделей автоматического распознавания речи GigaAM Multilingual.

GigaChat3.1-Audio-10B — большая языковая модель, которая обрабатывает аудиофайлы и голосовые сообщения без предварительного преобразования речи в текст. Модель распознает интонацию говорящего и определяет, с позитивной или негативной эмоцией произнесена реплика — по характеристикам голоса и нюансам произношения. Она способна обрабатывать записи длиной до трёх часов и ориентироваться внутри них: находить момент, где обсуждался конкретный вопрос, пересказывать отдельный отрезок или выдавать сводку всей записи со ссылками на таймкоды. Модель также различает в записи спикеров. Эти возможности можно использовать для разбора совещаний и звонков, навигации по записям, протоколирования.

GigaAM Multilingual — семейство моделей автоматического распознавания речи, одна из первых российских открытых моделей, которая работает с несколькими языками, и одна из лучших из открытых решений по качеству распознавания речи на русском.

«Голос — самый естественный способ общения с технологией, но и самый требовательный: любая ошибка в распознавании или неверно считанная эмоция сразу разрушает доверие к ассистенту. Поэтому мы считаем аудио точкой роста для рынка ИИ-помощников. Запуская эти модели в открытый доступ, мы даём мощный инструмент разработчикам и учёным. От синхронного голосового перевода до сервисов для людей с нарушениями речи — спектр применений у голосовых технологий очень широкий. А мультиязычность и возможность лёгкого обучения другим языкам открывает для них и международные перспективы», — отметил Антон Фролов, старший вице-президент, руководитель блока «Развитие генеративного ИИ» «Сбербанка».

Что получат разработчики

На основе GigaChat3.1-Audio-10B можно создавать:

  • сервисы транскрибации;
  • тренажёры произношения;
  • инструменты для оценки качества озвучки;
  • голосовые переводчики с пониманием контекста;
  • сервисы пересказа длинных записей.

GigaAM Multilingual поддерживает русский, английский, кыргызский, казахский и узбекский языки и доступна в двух версиях — компактной, которая работает на обычных процессорах, и флагманской, обеспечивающей более высокое качество распознавания. Подойдёт для колл-центров и голосовых ассистентов, расшифровки встреч, интервью и подкастов, голосового ввода в приложениях и автосубтитров.

Обе модели прошли предварительное обучение на большом числе языков, поэтому их можно быстро дообучить под дополнительные — в том числе языки стран СНГ. Для этого достаточно нескольких десятков часов размеченных аудиозаписей.

Научные статьи о новых моделях GigaChat3.1-Audio-10B и GigaAM Multilingual приняты на Interspeech 2026 — одну из ведущих международных конференций по речевым технологиям.

Обновлённая GigaChat Audio уже работает и внутри ИИ-помощника «ГигаЧат».

На правах рекламы.

Источник