中文

面向视图通用机器人操作的几何化依赖三维视觉表征学习

机器人学 2026-02-02 v1

摘要

现实世界的机器人操作需要具备鲁棒空间场景理解能力和跨多样化摄像机视角强泛化能力的视觉-运动策略。虽然近期的三维感知视觉表征取得了进展,但仍存在若干关键局限,包括在推理阶段依赖多视图观测,这在单视图受限场景中难以实现;场景建模不完整,无法捕捉精确操作所必需的整体和细粒度几何结构;以及缺乏有效的策略训练策略来保留和利用已获取的三维知识。为此,我们提出MethodName,一个面向视图通用机器人操作的统一表征-策略学习框架。MethodName引入了单视图三维预训练范式,利用多视图监督下的点云重建和前馈高斯溅写,学习整体几何表征。在策略学习阶段,MethodName通过多步骤蒸馏保留预训练的几何理解,并有效地将其转化为操作技能。我们在12个RLBench任务上进行实验,其中方法优于前一最先进方法平均成功率提升了12.7%。进一步的评估在六个代表性任务上表明,方法在零样本视图泛化方面表现强劲,在适度视角偏移下成功率仅下降22.0%,在大幅度视角偏移下仅下降29.7%,而最先进的方法则分别下降41.6%和51.5%。

关键词

引用

@article{arxiv.2601.22988,
  title  = {Learning Geometrically-Grounded 3D Visual Representations for View-Generalizable Robotic Manipulation},
  author = {Di Zhang and Weicheng Duan and Dasen Gu and Hongye Lu and Hai Zhang and Hang Yu and Junqiao Zhao and Guang Chen},
  journal= {arXiv preprint arXiv:2601.22988},
  year   = {2026}
}