中文

面向自动驾驶数据的图像到激光雷达自监督蒸馏

计算机视觉与模式识别 2022-03-31 v1 机器学习

摘要

在稀疏激光雷达点云中分割或检测物体是自动驾驶中使车辆在其三维环境中安全行动的两项重要任务。在三维语义分割或物体检测中性能最佳的方法依赖于大量标注数据。然而,为这些任务标注三维激光雷达数据繁琐且昂贵。在此背景下,我们提出一种针对自动驾驶数据定制的、用于三维感知模型的自监督预训练方法。具体而言,我们利用自动驾驶装置中同步且标定的图像与激光雷达传感器的可用性,将自监督预训练的图像表示蒸馏到三维模型中。因此,我们的方法不需要任何点云或图像标注。我们方法的关键要素是使用超像素,将视觉相似区域中的三维点特征与二维像素特征进行池化。然后,我们在匹配这些池化点特征与相应池化图像像素特征的自监督任务上训练一个三维网络。对比由超像素获得的区域的好处在于:(1) 将视觉一致区域中的像素和点分组在一起,产生更有意义的对比任务,生成适用于三维语义分割和三维物体检测的特征;(2) 所有不同区域在对比损失中具有相同权重,无论这些区域中采样了多少三维点;(3) 它减轻了因不同传感器间遮挡导致的点与像素错误匹配所产生的噪声。在自动驾驶数据集上的大量实验表明,我们的图像到激光雷达蒸馏策略生成的三维表示能很好地迁移到语义分割和物体检测任务上。

关键词

引用

@article{arxiv.2203.16258,
  title  = {Image-to-Lidar Self-Supervised Distillation for Autonomous Driving Data},
  author = {Corentin Sautier and Gilles Puy and Spyros Gidaris and Alexandre Boulch and Andrei Bursuc and Renaud Marlet},
  journal= {arXiv preprint arXiv:2203.16258},
  year   = {2022}
}

备注

Accepted to CVPR2022