Стартап научил голосовой ИИ молчать и слушать

Американский стартап Tavus, который делает разговорных ИИ-аватаров и технологии для них, выпустил Sparrow-2 – модель, которая в реальном времени следит за разговором и решает, когда голосовому ИИ стоит говорить, молчать или дать человеку закончить мысль. Она анализирует не только слова, но и интонацию, паузы, угуканье, перебивания, посторонние голоса и шум вокруг, обновляя состояние разговора. Поэтому несколько секунд тишины она может принять за раздумье и не обязательно будет реагировать на случайный разговор людей рядом (ни на кого не намекаем).
Похожее решение в июле показала OpenAI с моделью GPT-Live. Её голосовая модель тоже умеет слушать и говорить одновременно, выдерживать паузы и понимать перебивания. Но есть существенное отличие – OpenAI встроила эти умения непосредственно в голосовую модель. Тогда как Sparrow-2 отличается тем, что это отдельный слой управления разговором. Поэтому в Tavus можно подключить собственную LLM и голосовой движок, а Sparrow оставить отвечать только за то, когда агенту слушать и когда говорить. Можно добиться похожего на GPT-Live результата, но со своим (и, возможно, более бюджетным) ИИ.
Sparrow-2 закрытая, скачать и запустить её локально нельзя. Модель доступна через API и платформу Tavus. Число параметров компания не раскрывает. Сама Sparrow-2 заявлена как мультиязычная, у платформы Tavus заявлена поддержка 42 языков, включая русский.