Manipulate-Anything:用于自动化真实机器人操作的视觉语言模型
机器人学
2024-08-30 v3 计算机视觉与模式识别
摘要
大型项目如Open-X-Embodiment等广泛社区努力已有助于扩大机器人演示数据的规模。然而,仍有机会提高机器人演示数据的质量、数量和多样性。虽然视觉语言模型已被证明可自动生成演示数据,但其效用仅限于具有特权状态信息的环境,需要手工设计技能,并且仅限于与少数物体实例进行交互。我们提出了Manipulate-Anything,一种用于真实世界机器人操作的可扩展自动生成方法。不同于先前工作,我们的方法可以在没有任何特权状态信息、手工设计技能的情况下运行,并且可以操作任何静态物体。我们使用两个设置进行评估。首先,Manipulate-Anything成功为所有7个真实世界和14个仿真任务生成轨迹,显著优于现有方法如VoxPoser。其次,Manipulate-Anything生成的演示可以训练比使用人类演示或来自VoxPoser、Scaling-up和Code-As-Policies生成的数据更健壮的行为克隆政策。我们相信Manipulate-Anything可以是一种可扩展的方法,用于为机器人生成数据以及在零样本设置中解决新任务。项目页面:https://robot-ma.github.io/。
引用
@article{arxiv.2406.18915,
title = {Manipulate-Anything: Automating Real-World Robots using Vision-Language Models},
author = {Jiafei Duan and Wentao Yuan and Wilbert Pumacay and Yi Ru Wang and Kiana Ehsani and Dieter Fox and Ranjay Krishna},
journal= {arXiv preprint arXiv:2406.18915},
year = {2024}
}
备注
Project page: https://robot-ma.github.io/. All supplementary material, prompts and code can be found on the project page