中文

面向模仿学习的点云与视觉表征融合

机器人学 2025-02-20 v2 计算机视觉与模式识别

摘要

操纵学习需要使用能够访问丰富感知信息的策略,如点云或 RGB 图像。点云高效地捕捉几何结构,对于操纵任务在模仿学习中至关重要。相比之下,RGB 图像提供丰富的纹理和语义信息,对某些任务至关重要。现有方法通过将 2D 图像特征分配给点云来实现两者的融合,但这些方法常常丢失原始图像的全局上下文信息。本文提出了 FPV-Net,一种新颖的模仿学习方法,有效结合了点云和 RGB 两种模态的优势。我们的方法通过自适应层归一化条件化,使点云编码器依赖于全局和局部图像标记,充分利用两种模态的有利特性。在针对性强的 RoboCasa 数据集上进行的大量实验表明,仅依赖单一模态的局限性,而我们的 метод 在所有任务上均实现了最先进的性能。

关键词

引用

@article{arxiv.2502.12320,
  title  = {Towards Fusing Point Cloud and Visual Representations for Imitation Learning},
  author = {Atalay Donat and Xiaogang Jia and Xi Huang and Aleksandar Taranovic and Denis Blessing and Ge Li and Hongyi Zhou and Hanyi Zhang and Rudolf Lioutikov and Gerhard Neumann},
  journal= {arXiv preprint arXiv:2502.12320},
  year   = {2025}
}