中文

3D-MVP: 面向机器人操作的3D多视图预训练

机器人学 2025-03-25 v2 计算机视觉与模式识别

摘要

最近的研究表明,使用掩码自编码器在自我中心数据集上进行视觉预训练可以提高下游机器人任务的泛化能力。然而,这些方法仅在2D图像上进行预训练,而许多机器人应用需要3D场景理解。在这项工作中,我们提出了3D-MVP,一种使用掩码自编码器进行3D多视图预训练的新方法。我们利用机器人视图变换器,它使用多视图变换器来理解3D场景并预测夹爪位姿动作。我们将RVT的多视图变换器拆分为视觉编码器和动作解码器,并在大规模3D数据集(如Objaverse)上使用掩码自编码对其视觉编码器进行预训练。我们在一个虚拟机器人操作任务套件上评估了3D-MVP,并展示了相对于基线的性能提升。我们的结果表明,3D感知预训练是提高基于视觉的机器人操作策略泛化能力的一种有前景的方法。项目网站:https://jasonqsy.github.io/3DMVP

关键词

引用

@article{arxiv.2406.18158,
  title  = {3D-MVP: 3D Multiview Pretraining for Robotic Manipulation},
  author = {Shengyi Qian and Kaichun Mo and Valts Blukis and David F. Fouhey and Dieter Fox and Ankit Goyal},
  journal= {arXiv preprint arXiv:2406.18158},
  year   = {2025}
}

备注

CVPR 2025