用于激光雷达点云自监督预训练的掩码自编码器
计算机视觉与模式识别
2023-03-10 v3 机器学习
摘要
掩码自编码已成为文本、图像以及近来点云的 Transformer 模型的一种成功预训练范式。原始自动驾驶数据集是自监督预训练的合适候选,因为与 3D 目标检测(OD)等任务的标注相比,它们通常采集成本低廉。然而,用于点云的掩码自编码器的发展仅聚焦于合成与室内数据。因此,现有方法已将其表征与模型定制为具有同质点密度的小而密集的点云。在本工作中,我们研究自动驾驶场景中点云的掩码自编码,该场景点云稀疏且同一场景中不同物体的点密度可能急剧变化。为此,我们提出 Voxel-MAE,一种为体素表征设计的简单掩码自编码预训练方案。我们对基于 Transformer 的 3D 目标检测器骨干网络进行预训练,以重建被掩码的体素并区分空与非空体素。我们的方法在具有挑战性的 nuScenes 数据集上将 3D OD 性能提升了 1.75 mAP 点与 1.05 NDS。此外,我们表明通过 Voxel-MAE 预训练,仅需 40% 的标注数据即可超越随机初始化的等价模型。代码见 https://github.com/georghess/voxel-mae
引用
@article{arxiv.2207.00531,
title = {Masked Autoencoder for Self-Supervised Pre-training on Lidar Point Clouds},
author = {Georg Hess and Johan Jaxing and Elias Svensson and David Hagerman and Christoffer Petersson and Lennart Svensson},
journal= {arXiv preprint arXiv:2207.00531},
year = {2023}
}