Суверенный ИИ попал в зависимость от Nvidia Суверенный ИИ попал в зависимость от Nvidia Netflix отказался от американской «Игры в кальмара» Netflix отказался от американской «Игры в кальмара» Max открыл API для создания альтернативных клиентов Max открыл API для создания альтернативных клиентов Китай готовит замену литографам ASML Китай готовит замену литографам ASML

3i Technologies разработал облачный сервис для профессиональной обработки ТВ и радио-контента

🇷🇺 1 мин

Консорциум 3i Technologies разработал облачный сервис для профессиональной обработки речевых данных из медийного контента – 3i Speech Recognition API. Сервис позволяет с точностью более 90% переводить теле- и радио-эфиры и медиа-архивы ТВ-каналов и радиостанций в текстовый формат.

3i Speech Recognition API работает с аудио и видео любой длительности. Сервис обрабатывает загруженные в облако файлы в несколько раз быстрее реального времени звучания и выдает на выходе «стройный» текст, разбитый на предложения с расставленными знаками препинания. Бета-версия 3i Speech Recognition API открыта для публичного тестирования.

«Это специализированный сервис, ориентированный на обработку именно телевизионного или радио-контента. Мы разработали уникальные модели, которые позволили добиться очень высокой точности распознавания. Надеемся, что сервис будет полезен профессионалам, которые работают с медиа-контентом. В дальнейшем он может стать частью высокотехнологичных решений для массового потребителя, например, основой для перевода иностранных каналов и субтитрирования в режиме реального времени. Все технологии для создания такого продукта у компаний, входящих в консорциум, уже есть», — говорит председатель совета директоров консорциума 3i Technologies Алексей Любимов.

В сервисе используются языковые и акустические модели, построенные с применением машинного обучения, технологий рекуррентных нейронных сетей (Recurrent Neural Network, RNN) и взвешенных конечных автоматов (Weighted Finite State Transducer, WFST). Вычислительная инфраструктура реализована с ускорением на GPU, что позволяет получать многократный прирост производительности относительно CPU.

Языковые модели для повышения качества распознавания могут быть адаптированы под узкую предметную область. Например, для перевода в текст «экономических» или «отраслевых» передач, в которых спикеры используют профессиональную лексику.

Бета-версия 3i Speech Recognition поддерживает русский и английский язык. 3i Speech Recognition будет полезен в работе разработчиков программного обеспечения, системных интеграторов, специалистов в области создания и обработки медиаконтента (телерадиовещательные компании, продакшн-студии, креативные агентства, фрилансеры и т.д.). Сервис быстро и легко интегрируется в приложения и комплексные решения сторонних разработчиков.