中文

渲染与扩散:对齐图像和动作空间以实现基于扩散的行为克隆

机器人学 2024-05-29 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

在机器人学习领域,高维观测(如RGB图像)与低级机器人动作这两个本质上截然不同的空间之间的复杂映射构成了一个复杂的学习问题,尤其是在数据量有限的情况下。在这项工作中,我们引入了渲染与扩散(R&D),一种通过使用机器人3D模型的虚拟渲染,在图像空间内统一低级机器人动作和RGB观测的方法。利用这种联合观测-动作表示,它通过一个学习到的扩散过程来计算低级机器人动作,该过程迭代地更新机器人的虚拟渲染。这种空间统一简化了学习问题,并引入了对样本效率和空间泛化至关重要的归纳偏置。我们在仿真中彻底评估了R&D的几种变体,并在现实世界的六个日常任务中展示了它们的适用性。我们的结果表明,R&D表现出强大的空间泛化能力,并且比更常见的图像到动作方法更具样本效率。

关键词

引用

@article{arxiv.2405.18196,
  title  = {Render and Diffuse: Aligning Image and Action Spaces for Diffusion-based Behaviour Cloning},
  author = {Vitalis Vosylius and Younggyo Seo and Jafar Uruç and Stephen James},
  journal= {arXiv preprint arXiv:2405.18196},
  year   = {2024}
}

备注

Robotics: Science and Systems (RSS) 2024. Videos are available on our project webpage at https://vv19.github.io/render-and-diffuse/