Нейросеть научилась создавать полноценные видеоролики

Сбер представил нейросеть Kandinsky Video — первую в России генеративную модель для создания полноценных видеороликов по текстовому описанию. Модель генерирует видеоряд продолжительностью до восьми секунд с частотой 30 кадров в секунду. Архитектура нейросети состоит из двух ключевых блоков: первый отвечает за создание кадров, из которых складывается структура сюжета видео, а второй — за генерацию интерполяционных кадров, которые позволяют достичь плавности движений в финальном видео. В основе двух блоков лежит новая модель синтеза изображений по текстовым описаниям Kandinsky 3.0.

Оценить возможности нейросети Kandinsky Video можно на сайте и в Telegram-боте, где можно оставить заявку на доступ. Формат сгенерированного видео представляет собой непрерывную сцену с движением как объекта, так и фона. Именно это отличает видеоролики, синтезированные моделью Kandinsky Video, от анимационных видеороликов, в которых динамика достигается за счёт моделирования пролёта камеры относительно статичной сцены. Нейросеть создаёт видеоролики с разрешением 512×512 пикселей и различным соотношением сторон. Модель обучена на датасете из более чем 300 тыс. пар «текст-видео». Генерация видео занимает до трёх минут.

Алексей Клёсов

Вам также может понравиться

Искусственный интеллект научился считывать мозговые сигналы и предугадывать поведение человека

Чат-боты могут научиться обходить встроенные ограничения и нарушать закон

«Яндекс» создал прототип закадрового переводчика видео