中文

基于球面投影的 3D 等变视觉运动策略学习

机器人学 2025-10-31 v3

摘要

等变模型最近被证明可显著提升扩散策略的数值效率。然而,既有工作主要聚焦于由固定在工作空间内的多个摄像机生成的点云输入,而这种点云输入与现在常见的以眼-in-hand RGB 摄像机(如 GoPro)为主要输入模态的设定不兼容。本文通过在扩散策略模型中引入将 2D RGB 摄像机图像特征投影到球面上的过程,实现对 SO(3)\mathrm{SO}(3) 对称性的推理,从而无需显式重建点云。我们在仿真与实际环境中进行了大量实验,结果显示我们的方法在性能与样本效率方面均显著优于强大基线。我们的工作,称为图像到球面策略(ISP\textbf{ISP}),是首个仅使用单目 RGB 输入即可实现 robotic manipulation SO(3)\mathrm{SO}(3)-等变策略学习的框架。

关键词

引用

@article{arxiv.2505.16969,
  title  = {3D Equivariant Visuomotor Policy Learning via Spherical Projection},
  author = {Boce Hu and Dian Wang and David Klee and Heng Tian and Xupeng Zhu and Haojie Huang and Robert Platt and Robin Walters},
  journal= {arXiv preprint arXiv:2505.16969},
  year   = {2025}
}