Сбер представил нейросеть Kandinsky WM 1.0 для обучения роботов физике мира
Сбер анонсировал семейство генеративных моделей Kandinsky WM 1.0, способных создавать физически правдоподобные видеосцены для обучения систем Physical AI — беспилотного транспорта, роботов и промышленного оборудования. Код и веса моделей уже опубликованы под лицензией MIT и доступны разработчикам бесплатно.
Новые модели основаны на нейросети Kandinsky 5.0 Video Lite и дообучены на миллионах видео с камер роботов, беспилотных автомобилей и записях промышленных процессов. Они генерируют ролики длительностью около пяти секунд, демонстрирующие отдельные действия и ситуации, такие как манипуляции с предметами и дорожные сцены. Эти видеоролики могут использоваться для обучения систем компьютерного зрения и симуляторов беспилотного транспорта.
Особая ценность разработки — возможность синтезировать редкие, опасные или трудно воспроизводимые сценарии, например, ДТП, экстремальные погодные условия или отказы оборудования. В реальности такие данные либо отсутствуют, либо крайне дороги в сборе. Ранее использование видео, сгенерированных другими нейросетями, было затруднительным из-за множества ошибок, таких как искажения геометрии и перспективы. Разработчики Сбера под руководством Дениса Димитрова смогли решить эту проблему.
Для улучшения автомобильных сцен применялся этап обучения с подкреплением, где Kandinsky WM генерировали ролики, а другие нейросети оценивали их качество и давали обратную связь. Модели уже применяются в Центре робототехники «Сбера», а Институт AIRI использует их в собственном дорожном симуляторе. По словам Дениса Димитрова, это шаг к моделям мира — системам, которые понимают физическую реальность, предсказывают, что произойдет дальше, и могут действовать в ней самостоятельно.