机器人看机器人做:通过单目4D重建模仿铰接物体操作
机器人学
2024-09-27 v1 计算机视觉与模式识别
摘要
人类可以通过仅仅观察他人来学习操作新物体;赋予机器人从这种演示中学习的能力将能够提供一种指定新行为的自然接口。这项工作开发了 Robot See Robot Do (RSRD),一种从单个单目 RGB 人类演示中模仿铰接物体操作的方法,给定一个静态的多视角物体扫描。我们首先提出了 4D 可微部分模型 (4D-DPM),一种通过可微渲染从单目视频中恢复 3D 部分运动的方法。这种分析-合成方法在迭代优化中使用以部分为中心的特征场,从而能够使用几何正则化器从单个视频中恢复 3D 运动。基于此 4D 重建,机器人通过规划能够引发演示的物体部分运动的双臂运动来复制物体轨迹。通过将演示表示为以部分为中心的轨迹,RSRD 专注于复制演示的预期行为,同时考虑机器人自身的形态限制,而不是试图复现手的运动。我们在带有真实标注的 3D 部分轨迹上评估了 4D-DPM 的 3D 跟踪精度,并在双臂 YuMi 机器人上对 9 个物体各进行了 10 次试验,评估了 RSRD 的实际执行性能。RSRD 的每个阶段平均成功率达到 87%,在 90 次试验中总端到端成功率为 60%。值得注意的是,这是仅使用从大型预训练视觉模型中提取的特征场实现的——无需任何任务特定训练、微调、数据集收集或标注。项目页面:https://robot-see-robot-do.github.io
引用
@article{arxiv.2409.18121,
title = {Robot See Robot Do: Imitating Articulated Object Manipulation with Monocular 4D Reconstruction},
author = {Justin Kerr and Chung Min Kim and Mingxuan Wu and Brent Yi and Qianqian Wang and Ken Goldberg and Angjoo Kanazawa},
journal= {arXiv preprint arXiv:2409.18121},
year = {2024}
}
备注
CoRL 2024, Project page: https://robot-see-robot-do.github.io