Content-Review.com

Kandinsky научился делать видео со звуком

Сбер выпустил Kandinsky 6.0 Video, новую версию модели для генерации видео. Теперь она умеет одновременно генерировать не только картинку, но и звук – речь, музыку и другие звуки сцены. При этом звук не накладывается на готовый ролик, но создаётся одновременно с видео отдельной частью модели. По заявлению компании, особое внимание уделили говорящим людям и совпадению речи с движением губ.

Генерировать можно как из текстового описания, так и используя в качестве референса изображение. Продолжительность, правда, сейчас ограничена пятью секундами, а максимальное разрешение – Full HD, и то после апскейла. На данный момент для обычных пользователей модель доступна в ГигаЧате с ограничением 10 генераций в день (против примерно 2 на Veo Fast и 1 на Seedance на бесплатном тарифе). На наш взгляд, по качеству с Veo или Seedance модель не сравнилась, но и денег за неё пока не просят.

Всего Сбер выпустил две версии модели – Lite на 3 миллиарда параметров и Pro примерно на 29 миллиардов. Обе версии разработчики могут скачать и использовать в своих продуктах.

//