Xiaomi научила роботов осваивать новые задачи за 10 часов Вслед за Google DeepMind, NVIDIA и Physical Intelligence собственную универсальную модель для управления роботами представила ещё и Xiaomi Robotics. Компания анонсировала Xiaomi-Robotics-1 — VLA-модель, которая связывает зрение, язык и движения. Она получает изображение с камер и текстовую команду, после чего определяет, что именно делать роботу. Для предварительного обучения Xiaomi Robotics собрали более 100 тысяч часов манипуляций в 1700 сценариях — от домов и магазинов до промышленных площадок. Роботов туда, понятное дело, никто не возил: операторы записывали движения с помощью ручных захватов UMI с камерой. Затем длинные записи автоматически разбивали на фрагменты, а зрительно-языковая модель описывала, что происходило с захватом и объектами. После предварительного обучения в дело вошли сами роботы. Более 7200 часов они отрабатывали в реальных квартирах: приводили в порядок диван, разбирали обувные шкафы и по местам раскладывали кухонные принадлежности. После менее чем десяти часов демонстраций для каждой новой задачи модель успешно выполняла в среднем 75% тестовых заданий — против 40% у модели π0.5. Причём победа пришла оттуда, откуда не ждали (обычные задачки вроде складывания вещей в коробку не показали вау-эффекта): Xiaomi-Robotics-1 упаковывала телефоны с результатом 70% против 30% и подкладывала бумагу в принтер с результатом 70% против несчастных 20% у коллег. Исходный код и веса модели Xiaomi Robotics пока не выложила, но обещает, что скоро всё будет. Искать можно на GitHub и Hugging Face. @anti_robots
