中文

学习共享RGB-D场:面向LiDAR-相机3D感知的统一自监督预训练

计算机视觉与模式识别 2024-10-15 v2 人工智能 机器人学

摘要

构建用于自动驾驶中多模态感知模型训练的大规模标注数据集 presents significant challenges。这促使了自監督预训练策略的发展。然而,现有的预训练方法主要为每个模态采用不同的方法。相反,我们关注LiDAR-相机3D感知模型,提出一种统一的预训练策略,称为NeRF-Supervised Masked Auto Encoder (NS-MAE),通过共享公式优化所有模态。NS-MAE利用NeRF能够编码外观和几何信息的能力,实现对多模态数据的高效遮蔽重建。具体而言,从受损坏的LiDAR点云和图像中提取嵌入,基于视图方向和位置进行条件化。然后,这些嵌入被渲染为两个关键视角的多模态特征图:透视视角和鸟瞰视角。原始未受损数据作为自監督学习的重建目标。广泛的实验表明,NS-MAE在不同微调设置下的3D感知任务具有优异的可迁移性。值得注意的是,在标签高效微调设置下,NS-MAE在BEV图分割任务中超越了采用单独策略的先前SOTA预训练方法。

关键词

引用

@article{arxiv.2405.17942,
  title  = {Learning Shared RGB-D Fields: Unified Self-supervised Pre-training for Label-efficient LiDAR-Camera 3D Perception},
  author = {Xiaohao Xu and Ye Li and Tianyi Zhang and Jinrong Yang and Matthew Johnson-Roberson and Xiaonan Huang},
  journal= {arXiv preprint arXiv:2405.17942},
  year   = {2024}
}

备注

8 pages