СРОЧНО:Новые смартфоны и технологии — в ленте TehnoRexВсе новости →
НОВОСТИ

Xiaomi выложила CocktailASR-1: модель расшифрует только одного человека в шумной комнате

Xiaomi открыла веса CocktailASR-1: 4,11% WER на LibriMix, около миллиона часов обучающих данных и лицензия Apache 2.0. Что заявлено, а что нет.

Xiaomi выложила CocktailASR-1: модель расшифрует только одного человека в шумной комнате
Поделиться
Содержание 4
  1. 01Модель для «коктейльной вечеринки»: в чём задача
  2. 02Какие цифры заявлены и на каких данных обучали
  3. 03Где это применяют на практике
  4. 04Применима ли модель в Беларуси

Три голоса разом в кафе и шум кофемашины — почти худший случай для распознавания речи. 11 сентября 2026 года Xiaomi открыла веса Xiaomi-CocktailASR-1: ей хватает короткого образца голоса, чтобы расшифровывать только одного человека. Файлы — на Hugging Face и GitHub, Apache 2.0.

Модель для «коктейльной вечеринки»: в чём задача

Это проблема «коктейльной вечеринки»: человек в шумной комнате следит за одним собеседником, а микрофон получает единый смешанный сигнал. Схема «выделить источник, потом распознать» копит ошибки двух моделей. Здесь разделения нет: образец голоса на 1–4 секунды, секунда тишины и запись дают транскрипт нужного говорящего.

Ловушка обратная: обученная давить чужие голоса модель приглушает и единственного говорящего. В корпусе AliMeeting перекрытие речи занимает лишь 30–40% времени, поэтому одиночные примеры добавляли отдельно.

Какие цифры заявлены и на каких данных обучали

Кодировщик — 0,6 млрд параметров (Data2Vec2 с FBank-признаками), плюс адаптер и языковая основа Qwen3-8B: суммарно около 8,6 млрд, отдельной цифры в отчёте нет.

Данных три пула: около 400 тыс. часов многоспикерных записей (AMI, AliMeeting, LibriMix и внутренние диалоги), 600 тыс. часов односпикерных пар и 10 тыс. часов «негативов» без нужного голоса.

Метрики: WER 4,11% на LibriMix 2mix и 2,90% на LibriSpeechMix 2mix (у Qwen3-ASR-1.7b — 68,75% и 92,17%); 21,81% на AMI SDM и 20,63% на AliMeeting Far. Когда нужного голоса нет, отказ срабатывает в 79,59% случаев на LibriSpeech Neg и лишь в 68,54% на китайских негативах. Все цифры — из отчёта Xiaomi, независимой проверки нет.

Где это применяют на практике

В отчёте названы умный дом, носимые устройства и переговорные: важно не только вытащить речь из шума, но и не сработать ложно, когда владелец молчит. Документ подписан командой Xiaoai Plus ASR — голосовым подразделением Xiaomi.

Китайские медиа упоминают проверки на совещаниях и в салоне авто, но списка продуктов нет. Открытые веса позволяют встроить распознавание прямо в устройство — как обсуждают для смартфонов с моделями на 30 млрд параметров.

Применима ли модель в Беларуси

Официально в Беларуси CocktailASR-1 не продаётся: это файл весов, а не товар, и стоит он ноль. Apache 2.0 разрешает коммерческое использование, но гарантии и сервиса Xiaomi нет.

Ограничение — языки: тесты только на английском и китайском, по русскому и белорусскому результатов нет. Цену в BYN не привожу — подтверждённых прайсов на аренду GPU в Беларуси нет, а выдуманная цифра хуже пробела. Для русскоязычных задач логичнее открытые модели вроде GigaChat 3.5 Reasoning.