DistillBEV:通过跨模态知识蒸馏提升多相机三维目标检测
计算机视觉与模式识别
2023-09-27 v1 机器人学
摘要
基于多相机鸟瞰图(BEV)学习表征的三维感知正成为趋势,因为相机在自动驾驶行业量产中具备成本效益。然而,多相机BEV与基于LiDAR的三维目标检测之间存在显著的性能差距。一个关键原因是LiDAR能捕获准确的深度及其他几何测量,而仅从图像输入推断此类三维信息 notoriously 困难。本工作中,我们提出通过训练一个基于多相机BEV的学生检测器来模仿一个训练良好的基于LiDAR的教师检测器的特征,从而提升其表征学习。我们提出有效的平衡策略,迫使学生聚焦于从教师学习关键特征,并将知识迁移推广到具有时间融合的多尺度层。我们在多个具有代表性的多相机BEV模型上进行了广泛评估。实验表明,我们的方法相较学生模型带来了显著提升,在流行基准nuScenes上取得了最先进的性能。
引用
@article{arxiv.2309.15109,
title = {DistillBEV: Boosting Multi-Camera 3D Object Detection with Cross-Modal Knowledge Distillation},
author = {Zeyu Wang and Dingwen Li and Chenxu Luo and Cihang Xie and Xiaodong Yang},
journal= {arXiv preprint arXiv:2309.15109},
year = {2023}
}
备注
ICCV 2023