中文

深度助力:通过深度信息注入改进预训练的基于 RGB 的策略

机器人学 2024-08-12 v1

摘要

3D 感知能力对于可泛化的机器人操作至关重要。尽管近期的基础模型在基于 RGB 的输入的感知和决策方面取得了显著进展,但它们缺乏 3D 感知限制了其在细粒度机器人操作任务中的有效性。为了解决这些局限性,我们提出了深度信息注入(DI²)框架,该框架利用 RGB-深度模态进行策略微调,同时仅依赖 RGB 图像进行鲁棒高效的部署。具体而言,我们引入了深度补全模块(DCM),用于提取与深度信息相关的空间先验知识,并从 RGB 输入生成虚拟深度信息以辅助策略部署。进一步,我们提出了深度感知码本(DAC),用于消除噪声并减少深度预测中的累积误差。在推理阶段,该框架利用 RGB 输入和准确预测的深度数据来生成操作动作。我们在模拟 LIBERO 环境和真实场景中进行了实验,实验结果证明我们的方法可以有效增强预训练的基于 RGB 的策略的 3D 感知能力,用于机器人操作。网站发布于 https://gewu-lab.github.io/DepthHelps-IROS2024。

关键词

引用

@article{arxiv.2408.05107,
  title  = {Depth Helps: Improving Pre-trained RGB-based Policy with Depth Information Injection},
  author = {Xincheng Pang and Wenke Xia and Zhigang Wang and Bin Zhao and Di Hu and Dong Wang and Xuelong Li},
  journal= {arXiv preprint arXiv:2408.05107},
  year   = {2024}
}

备注

accepted by IROS 2024