TiGDistill-BEV:基于目标内部几何学习蒸馏的多视角BEV 3D 对象检测
计算机视觉与模式识别
2024-12-31 v1
摘要
准确的多视角3D对象检测对于自动驾驶等应用至关重要。研究人员一直致力于利用激光雷达的精确空间信息通过深度监督和鸟瞰图(BEV)特征蒸馏等方法来增强基于相机的检测器。然而,现有方法常因激光雷达和相机数据表示之间的内在差异面临挑战。本文引入TiGDistill-BEV,这是一种有效桥接这一差距的方法,利用多种传感器的优势。我们的方法将来自不同模态(例如激光雷达)的知识蒸馊到基于相机的学生检测器中,通过目标内部几何学习方案利用深度和BEV特征来增强基于相机的BEV检测器。特别地,我们提出了两个关键模块:一个用于学习对象内部低层相对深度关系的内深度监督模块,使检测器能够更深入地理解对象级别的空间结构,以及一个用于传递前景目标不同关键点高层语义的内特征BEV蒸馈模块。为进一步缓解域间差距,我们结合了跨通道和跨关键点蒸馈来建模特征相似性。在nuScenes基准测试中进行的广泛实验表明,TiGDistill-BEV显著提升了基于相机的仅检测器,实现了62.8%的NDS,显著超过了前述方法。代码可在:https://github.com/Public-BOTs/TiGDistill-BEV.git 获取。
引用
@article{arxiv.2412.20911,
title = {TiGDistill-BEV: Multi-view BEV 3D Object Detection via Target Inner-Geometry Learning Distillation},
author = {Shaoqing Xu and Fang Li and Peixiang Huang and Ziying Song and Zhi-Xin Yang},
journal= {arXiv preprint arXiv:2412.20911},
year = {2024}
}
备注
13 pages, 8 figures. arXiv admin note: substantial text overlap with arXiv:2212.13979