Skild AI учит роботов новым задачам по одному видео
Модель S1 использует видео как prompt и выполняет незнакомые многошаговые задачи без отдельного дообучения.
Skild AI заявила, что ее robotics foundation model S1 может выучить новую физическую задачу по одному видео, а затем выполнить ее на роботе без изменения весов модели и без task-specific post-training.
Компания описывает это как in-context learning для робототехники: вместо текстового описания или часов teleoperation-данных оператор показывает роботу, что нужно сделать. По словам Skild, S1 может собирать незнакомые многошаговые сценарии вроде пересадки растения, приготовления блинов, pour-over coffee и kit assembly; горизонт задачи может доходить до 10 минут.
NVIDIA говорит, что Skild построила S1 на ее AI-инфраструктуре и использует Isaac Lab, Isaac Sim, Omniverse и Cosmos для симуляции, генерации данных, обучения и внедрения. Компании также работают над GPU-ускоренными симуляционными solvers для физического контакта и манипуляций.
Главный сигнал не в том, что роботы внезапно стали универсальными домашними работниками. Важно другое: робототехника приближается к тому же принципу prompting, который сделал языковые модели полезными. Показал новую задачу во время работы, избежал нового цикла сбора данных и быстрее адаптировался к изменившемуся складу или производству.
Источники
- NVIDIA Newsroomblogs.nvidia.com
- Skild AI S1 research postskild.ai