Occupancy-MAE:基于掩码占据自编码器的大规模 LiDAR 点云自监督预训练
计算机视觉与模式识别
2023-10-10 v7
摘要
当前自动驾驶中的感知模型严重依赖大规模标注 3D 数据,其标注成本高且耗时。本工作提出一种解决方案,通过对大规模无标注室外 LiDAR 点云使用掩码自编码器(MAE)进行预训练,以减少对标注 3D 训练数据的依赖。尽管现有掩码点云自编码方法主要关注小规模室内点云或基于柱体的大规模室外 LiDAR 数据,我们的方法引入了一种新的自监督掩码占据预训练方法,称为 Occupancy-MAE,专为基于体素的大规模室外 LiDAR 点云设计。Occupancy-MAE 利用室外 LiDAR 点云逐渐稀疏的体素占据结构,并结合距离感知随机掩码策略与占据预测 pretext task。通过基于体素到 LiDAR 的距离随机掩码,并预测整个 3D 周边场景的掩码占据结构,Occupancy-MAE 促使仅使用少量可见体素提取高层语义信息以重建被掩码体素。大量实验证明了 Occupancy-MAE 在多个下游任务中的有效性。对于 3D 目标检测,Occupancy-MAE 将 KITTI 数据集上车辆检测所需标注数据减少一半,并在 Waymo 数据集上将小目标检测 AP 提升约 2%。对于 3D 语义分割,Occupancy-MAE 以约 2% mIoU 优于从头训练。对于多目标跟踪,Occupancy-MAE 在 AMOTA 和 AMOTP 上分别将从头训练提升约 1%。代码公开于 https://github.com/chaytonmin/Occupancy-MAE。
引用
@article{arxiv.2206.09900,
title = {Occupancy-MAE: Self-supervised Pre-training Large-scale LiDAR Point Clouds with Masked Occupancy Autoencoders},
author = {Chen Min and Xinli Xu and Dawei Zhao and Liang Xiao and Yiming Nie and Bin Dai},
journal= {arXiv preprint arXiv:2206.09900},
year = {2023}
}
备注
Accepted by TIV