BEV-LGKD:一种用于 BEV 3D 目标检测的统一激光雷达引导知识蒸馏框架
计算机视觉与模式识别
2022-12-02 v1
摘要
近来,鸟瞰图(BEV)表示在多视角 3D 目标检测中获得了越来越多的关注,其在自动驾驶中已展现出有前景的应用。尽管多视角相机系统可以低成本部署,但深度信息的缺失使得当前方法采用大型模型以获得良好性能。因此,提升 BEV 3D 目标检测的效率至关重要。知识蒸馏(KD)是训练高效且准确模型最实用的技术之一。然而,据我们所知,BEV KD 仍未被充分探索。与图像分类任务不同,BEV 3D 目标检测方法更为复杂且由若干组件构成。在本文中,我们提出了一个名为 BEV-LGKD 的统一框架,以师生方式迁移知识。然而,由于 RGB 相机中大量的背景信息,直接将师生范式应用于 BEV 特征无法取得令人满意的结果。为解决该问题,我们提出利用激光雷达点的定位优势。具体而言,我们将激光雷达点变换至 BEV 空间,并为师生范式生成前景掩码和视角相关掩码。需注意,我们的方法仅使用激光雷达点来引导 RGB 模型之间的 KD。由于深度估计的质量对 BEV 感知至关重要,我们进一步将深度蒸馏引入框架。我们的统一框架简单而有效,并实现了显著的性能提升。代码将公开。
引用
@article{arxiv.2212.00623,
title = {BEV-LGKD: A Unified LiDAR-Guided Knowledge Distillation Framework for BEV 3D Object Detection},
author = {Jianing Li and Ming Lu and Jiaming Liu and Yandong Guo and Li Du and Shanghang Zhang},
journal= {arXiv preprint arXiv:2212.00623},
year = {2022}
}
备注
12pages