IGOR:图像-目标表示是具身 AI 中基础模型的原子控制单元
机器人学
2024-11-05 v1 人工智能
摘要
我们提出了图像-目标表示(IGOR),旨在学习一个统一、语义一致的动作空间,涵盖人类和各类机器人。通过这一统一的潜在动作空间,IGOR 实现了大规模机器人和人类活动数据之间的知识迁移。我们通过将初始图像与其目标状态之间的视觉变化压缩为潜在动作来实现这一点。IGOR 允许我们为互联网规模的视频数据生成潜在动作标签。这一统一的潜在动作空间使得在机器人和人类执行的广泛任务上训练基础策略模型和世界模型成为可能。我们证明:(1)IGOR 为人类和机器人学习了一个语义一致的动作空间,描述了表征物理交互知识的各种可能物体运动;(2)IGOR 可以借助潜在动作模型和世界模型,将一个视频中的物体运动"迁移"到其他视频中,即使跨人类和机器人;(3)IGOR 可以通过基础策略模型将潜在动作与自然语言对齐,并将潜在动作与低级策略模型整合以实现有效的机器人控制。我们认为 IGOR 为人类到机器人的知识迁移与控制开辟了新的可能性。
引用
@article{arxiv.2411.00785,
title = {IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI},
author = {Xiaoyu Chen and Junliang Guo and Tianyu He and Chuheng Zhang and Pushi Zhang and Derek Cathera Yang and Li Zhao and Jiang Bian},
journal= {arXiv preprint arXiv:2411.00785},
year = {2024}
}