学习共享RGB-D场:面向LiDAR-相机3D感知的统一自监督预训练
计算机视觉与模式识别
2024-10-15 v2 人工智能
机器人学
摘要
构建用于自动驾驶中多模态感知模型训练的大规模标注数据集 presents significant challenges。这促使了自監督预训练策略的发展。然而,现有的预训练方法主要为每个模态采用不同的方法。相反,我们关注LiDAR-相机3D感知模型,提出一种统一的预训练策略,称为NeRF-Supervised Masked Auto Encoder (NS-MAE),通过共享公式优化所有模态。NS-MAE利用NeRF能够编码外观和几何信息的能力,实现对多模态数据的高效遮蔽重建。具体而言,从受损坏的LiDAR点云和图像中提取嵌入,基于视图方向和位置进行条件化。然后,这些嵌入被渲染为两个关键视角的多模态特征图:透视视角和鸟瞰视角。原始未受损数据作为自監督学习的重建目标。广泛的实验表明,NS-MAE在不同微调设置下的3D感知任务具有优异的可迁移性。值得注意的是,在标签高效微调设置下,NS-MAE在BEV图分割任务中超越了采用单独策略的先前SOTA预训练方法。
关键词
引用
@article{arxiv.2405.17942,
title = {Learning Shared RGB-D Fields: Unified Self-supervised Pre-training for Label-efficient LiDAR-Camera 3D Perception},
author = {Xiaohao Xu and Ye Li and Tianyi Zhang and Jinrong Yang and Matthew Johnson-Roberson and Xiaonan Huang},
journal= {arXiv preprint arXiv:2405.17942},
year = {2024}
}
备注
8 pages