Сбер представил новую линейку генеративных моделей Kandinsky WM 1.0. Эти модели обучены на создании видео, которые более точно соответствуют законам физики, что делает их подходящими для обучения физических систем AI. Основой моделей является нейросеть Kandinsky 5.0 Video Lite, которая была дополнительно обучена на видео с камер роботов, беспилотных автомобилей и записей производственных процессов. Эти модели особенно ценятся в ситуациях, где реальные съемки невозможно провести или они крайне затруднены: они могут генерировать видео редких и опасных сценариев, что полезно для тренировки роботов и автономного транспорта. Код и веса нейросетей опубликованы под лицензией MIT и доступны всем разработчикам по всему миру бесплатно.
Physical AI или физический ИИ — это класс систем искусственного интеллекта, которые способны воспринимать физический мир, понимать его динамику и управлять реальными устройствами. В отличие от языковых моделей, для физического ИИ открытых обучающих данных в необходимом объёме попросту не существует. Сбор таких данных требует значительных ресурсов: нужны устройства, датчики, операторы, контролируемая среда. Например, автомобиль, укомплектованный камерами и датчиками, накапливает около 5000 часов видео в год, тогда как современным моделям необходимо миллионы часов. При этом многие редкие и сложные сценарии, такие как ДТП или экстремальные погодные условия, невозможно воспроизводить в реальной жизни.
По мнению Яна Лекуна, лауреата премии Тьюринга и одного из основателей глубокого обучения, четырёхлетний ребенок получает через зрение больше информации, чем содержится во всех текстах, использованных для обучения крупнейших языковых моделей. Таким образом, следующий этап в развитии физического ИИ — это обучение на видео, и синтетические данные становятся ключевым средством для преодоления пробелов в объёмах данных.
Сгенерированные моделями Kandinsky WM видео длиной около 5 секунд отражают отдельные действия: манипуляции с предметами (взятие, размещение, разрезание), дорожные ситуации (перестроение, проезд перекрестка) и этапы производственных процессов — это базовые «кирпичики», из которых строится обучение автономных систем. Это первое поколение нейросетей на пути к полноценным моделям мира — системам, которые могут моделировать развитие сцены во времени и служить симуляторами для обучения и тестирования роботов. Кроме генерации данных, такие нейросети могут быть основой для систем управления: физическая интуиция, приобретенная в процессе генерации видео, переносится в модели действий роботов.
Как обучали Kandinsky WM
Базовые модели генерации видео иногда нарушают простые физические законы: объекты могут деформироваться, перспектива искажаться, а движения выглядеть неестественно. Чтобы повысить физическую достоверность, команда дообучила Kandinsky 5.0 Video Lite на миллионах реальных видеосцен — автомобили, роботы, промышленные процессы и сложные движения объектов. Важно отметить, что отдельные аспекты, например автомобильные сцены, были дополнительно улучшены с использованием методов обучения с подкреплением: специальные модели оценивали видео на предмет сохранения формы объектов, геометрии и естественности движения. На основе этой обратной связи Kandinsky научился создавать более физически правдоподобные видео. Подробности разработки команда представила в статье на Хабре.
Кому будут полезны новые модели
Kandinsky WM 1.0 — это первое открытое семейство российских моделей для генерации физически достоверных данных. В мире таких систем всего несколько. Эти модели найдут применение у разработчиков беспилотного транспорта, включая легковые автомобили, грузовики и роботакси, а также компаниям в сфере промышленной автоматизации: производителям манипуляторов, а также промышленных, сервисных и антропоморфных роботов, и командам, работающим над компьютерным зрением в производственной среде. Они также будут полезны исследователям, университетам и стартапам, которым нужна экономия ресурсов при сборе обучающих данных.
Модели уже применяются Центром робототехники Сбера для обучения своих роботов, а также институтом AIRI в их дорожном симуляторе.
Денис Димитров, CTO Kandinsky и управляющий директор по исследованию данных Сбера, отметил:
«Стремясь понять устройство нашего мира, лучшие умы человечества открывали физические законы на протяжении тысячелетий. Однако знание уравнения и умение предсказать реальное событие — это совершенно разные вещи. Чтобы предсказать, как будет вести себя предмет на мокром конвейере, необходимо учитывать множество параметров, о которых мы не знаем. Есть ситуации, которые вообще не описываются уравнениями, как, например, поведение пешехода перед беспилотным автомобилем. Человек решает эту задачу не вычислением, а интуицией, основанной на опыте. Наши модели учатся так же — на видео реального мира — и позволяют «прожить» виртуально даже те сценарии, которые невозможно или опасно воспроизводить. Это шаг к моделям мира — системам, способным понимать физическую реальность, предсказывать будущее и действовать в нём самостоятельно».