TiG-BEV:基于目标内部几何学习的多视角 BEV 三维目标检测
计算机视觉与模式识别
2022-12-29 v1 人工智能
摘要
为实现准确且低成本的三维目标检测,现有方法提出利用 LiDAR 模态提供的空间线索(如稠密深度监督与鸟瞰图(BEV)特征蒸馏)来增强基于相机的多视角检测器。然而,它们直接在 LiDAR 与相机之间进行逐点模仿,忽视了前景目标的内部几何,并受困于二维与三维特征之间的模态鸿沟。本文中,我们提出将 LiDAR 模态的目标内部几何学习方案引入基于相机的 BEV 检测器,用于稠密深度与 BEV 特征,称为 TiG-BEV。首先,我们引入内部深度监督模块,以学习不同前景像素间的底层相对深度关系,使基于相机的检测器能更好地理解目标级空间结构。其次,我们设计内部特征 BEV 蒸馏模块,以模仿前景目标内不同关键点的高层语义。为进一步缓解两模态间的 BEV 特征鸿沟,我们采用通道间与关键点间蒸馏进行特征相似性建模。借助我们的目标内部几何蒸馏,TiG-BEV 在 nuScenes val 集上可分别为 BEVDepth 提升 +2.3% NDS 与 +2.4% mAP,为 BEVDet 提升 +9.1% NDS 与 +10.3% mAP。代码将发布于 https://github.com/ADLab3Ds/TiG-BEV。
引用
@article{arxiv.2212.13979,
title = {TiG-BEV: Multi-view BEV 3D Object Detection via Target Inner-Geometry Learning},
author = {Peixiang Huang and Li Liu and Renrui Zhang and Song Zhang and Xinli Xu and Baichao Wang and Guoyi Liu},
journal= {arXiv preprint arXiv:2212.13979},
year = {2022}
}
备注
Code link: https://github.com/ADLab3Ds/TiG-BEV