BEV-MAE:自动驾驶场景下用于点云预训练的鸟瞰图掩码自编码器
计算机视觉与模式识别
2024-01-23 v2
摘要
现有面向自动驾驶场景的基于 LiDAR 的 3D 目标检测方法主要采用从零训练范式。遗憾的是,该范式严重依赖大规模标注数据,而其采集成本高昂且耗时。自监督预训练是缓解这种对大量标注数据依赖的有效且理想途径。本工作中,我们提出 BEV-MAE,一种用于自动驾驶中基于 LiDAR 的 3D 目标的高效掩码自编码器预训练框架。具体而言,我们提出鸟瞰图(BEV)引导掩码策略,以在 BEV 视角下引导 3D 编码器学习特征表示,并避免预训练期间复杂解码器设计。此外,我们引入可学习点 token 以维持 3D 编码器对掩码点云输入微调时的一致感受野大小。基于自动驾驶场景中室外点云的特性(即远处物体的点云更稀疏),我们提出点密度预测以使 3D 编码器学习位置信息,而该信息对目标检测至关重要。实验结果表明,BEV-MAE 超越了先前最先进的自监督方法,并取得了良好的预训练效率。此外,基于 TransFusion-L,BEV-MAE 取得了新的最先进基于 LiDAR 的 3D 目标检测结果,在 nuScenes 基准上达到 73.6 NDS 与 69.6 mAP。源代码将发布于 https://github.com/VDIGPKU/BEV-MAE
引用
@article{arxiv.2212.05758,
title = {BEV-MAE: Bird's Eye View Masked Autoencoders for Point Cloud Pre-training in Autonomous Driving Scenarios},
author = {Zhiwei Lin and Yongtao Wang and Shengxiang Qi and Nan Dong and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2212.05758},
year = {2024}
}
备注
Accepted at AAAI 2024