中文

VERM:利用基础模型为高效3D机器人操作创建虚拟眼睛

机器人学 2025-12-19 v1 计算机视觉与模式识别

摘要

在执行3D操作任务时,机器人必须基于来自多个固定摄像头的感知进行动作规划。多摄像头设置引入大量冗余和无关信息,这会增加计算成本,迫使模型在提取关键任务细节方面耗费额外的训练时间。为筛选冗余信息并准确提取任务相关特征,我们提出VERM(Virtual Eye for Robotic Manipulation)方法,利用基础模型的知识在构建的3D点云中想象一个虚拟任务自适应视角,高效捕获必要信息并缓解遮挡。为促进3D动作规划和精细操作,我们进一步设计了深度感知模块和动态粗到细程序。大量实验结果表明,我们的方法在仿真基准RLBench和真实世界评估中均显著优于先前最先进的方法,在训练时间上实现1.89倍加速,在推理速度上实现1.54倍加速。更多结果可在项目网站https://verm-ral.github.io查阅。

关键词

引用

@article{arxiv.2512.16724,
  title  = {VERM: Leveraging Foundation Models to Create a Virtual Eye for Efficient 3D Robotic Manipulation},
  author = {Yixiang Chen and Yan Huang and Keji He and Peiyan Li and Liang Wang},
  journal= {arXiv preprint arXiv:2512.16724},
  year   = {2025}
}

备注

Accepted at RA-L 2025