中文

基于深度感知预训练的视觉机器人操作

机器人学 2024-01-18 v1

摘要

近期关于视觉表征学习的工作已显示出对机器人操作任务的有效性。然而,大多数现有工作仅在2D图像或自我中心视频上预训练视觉骨干网络,忽略了机器人学习在3D空间中行动的事实,而这很难从2D观察中学习。本文研究了利用公开可用的大规模3D数据为视觉骨干网络进行预训练以改进操作策略学习的有效性。我们的方法,即面向机器人学的深度感知预训练(DPR),使仅使用RGB的骨干网络能够通过自监督对比学习来学习3D场景表征,其中深度信息作为辅助知识。在操作策略学习和推理过程中无需3D信息,使得我们的模型在3D空间操作中兼具效率和有效性。此外,我们引入了一种将机器人本体感知注入策略网络的新方法,使操作模型具有鲁棒性和泛化性。我们在实验中证明,所提出的框架在模拟和真实机器人上的各种机器人任务中,均提升了对未见物体和视觉环境的性能。

关键词

引用

@article{arxiv.2401.09038,
  title  = {Visual Robotic Manipulation with Depth-Aware Pretraining},
  author = {Wanying Wang and Jinming Li and Yichen Zhu and Zhiyuan Xu and Zhengping Che and Yaxin Peng and Chaomin Shen and Dong Liu and Feifei Feng and Jian Tang},
  journal= {arXiv preprint arXiv:2401.09038},
  year   = {2024}
}

备注

submitted to ICRA2024