中文

BEVDistill:面向多视角三维目标检测的跨模态BEV蒸馏

计算机视觉与模式识别 2022-11-18 v1

摘要

从多图像视角进行三维目标检测是视觉场景理解中基础且具挑战性的任务。得益于低成本与高效率,多视角三维目标检测已展现出良好的应用前景。然而,由于缺少深度信息,通过透视视角准确检测物体极为困难。当前方法倾向于采用沉重的图像编码器骨干网络,使其难以在实际部署中应用。与图像不同,LiDAR点云在提供空间线索方面更具优势,可实现高精度定位。本文探索将基于LiDAR的检测器引入多视角三维目标检测。我们不直接训练深度预测网络,而是在鸟瞰图(BEV)空间中统一图像与LiDAR特征,并以师生范式跨异质表示自适应迁移知识。为此,我们提出BEVDistill,一种用于多视角三维目标检测的跨模态BEV知识蒸馏(KD)框架。大量实验表明,该方法在极具竞争力的基线BEVFormer上优于当前KD方法,且推理阶段不引入任何额外成本。值得注意的是,我们的最佳模型在nuScenes测试排行榜上取得59.4 NDS,相较各类基于图像的检测器实现了新的SOTA。代码将发布于 https://github.com/zehuichen123/BEVDistill。

关键词

引用

@article{arxiv.2211.09386,
  title  = {BEVDistill: Cross-Modal BEV Distillation for Multi-View 3D Object Detection},
  author = {Zehui Chen and Zhenyu Li and Shiquan Zhang and Liangji Fang and Qinhong Jiang and Feng Zhao},
  journal= {arXiv preprint arXiv:2211.09386},
  year   = {2022}
}