Xiaomi выпустила ИИ-модель CocktailASR-1 для распознавания речи в шумных помещениях

Материал подготовлен искусственным интеллектом на основе нескольких источников — ссылки на оригиналы приведены ниже.
Xiaomi представила открытую ИИ-модель CocktailASR-1, предназначенную для выделения и расшифровки речи конкретного человека в условиях, когда несколько людей говорят одновременно. Модель использует короткий образец голоса в качестве эталона и, по данным Xiaomi, превосходит существующие аналоги в тестах с многоголосными записями. Она доступна на GitHub и Hugging Face.
Ключевые факты
- CocktailASR-1 — открытая ИИ-модель Xiaomi для распознавания речи в условиях, когда несколько человек говорят одновременно.
- Для работы модели требуется короткий образец голоса целевого человека, который используется как эталон.
- По данным Xiaomi, модель показала ведущие результаты в тестах с многоголосными записями, превзойдя существующие аналоги.
- Если голос-образец отсутствует в записи, модель выдаёт пустой текст и не пытается расшифровать речь других людей.
- Модель доступна на GitHub и Hugging Face.
Возможности модели
CocktailASR-1 решает проблему «эффекта коктейльной вечеринки», когда наложение голосов усложняет распознавание речи. В отличие от модели OmniVoice, которая генерирует речь, CocktailASR-1 выделяет и расшифровывает речь конкретного человека. Модель использует короткий образец голоса как эталон для идентификации нужного говорящего в записи с несколькими участниками. В тестах с многоголосными образцами, по заявлению Xiaomi, модель продемонстрировала ведущие результаты и превзошла существующие аналоги. CocktailASR-1 также работает с записями одного говорящего и не делает необоснованных предположений, если эталонный голос отсутствует.
Логика и доступность
Модель включает режим цепочки рассуждений, позволяющий пользователям изучать логику расшифровки. CocktailASR-1 выпущена как открытая модель и доступна на GitHub и Hugging Face.