MonoTAKD:用于单目3D目标检测的助教知识蒸馏
计算机视觉与模式识别
2025-03-27 v3
摘要
单目3D目标检测(Mono3D)由于单目相机传感器的成本效益和丰富的视觉上下文,在自动驾驶应用中具有显著前景。然而,深度模糊性构成了重大挑战,因为它需要从单张图像中提取精确的3D场景几何,导致从基于LiDAR的教师模型向基于相机的学生模型传递知识时性能次优。为了促进有效的蒸馏,我们引入了单目助教知识蒸馏(MonoTAKD),它提出了一种基于相机的助教(TA)模型,利用较小的特征表示差距向学生模型传递稳健的3D视觉知识。此外,我们将3D空间线索定义为捕捉教师模型和TA模型之间差异的残差特征。然后我们利用这些线索来提高学生模型的3D感知能力。实验结果表明,我们的MonoTAKD在KITTI3D数据集上达到了最先进的性能。此外,我们在nuScenes和KITTI原始数据集上评估了性能,以展示我们的模型在多视图3D和无监督数据设置下的泛化能力。我们的代码可在https://github.com/hoiliu-0801/MonoTAKD获取。
引用
@article{arxiv.2404.04910,
title = {MonoTAKD: Teaching Assistant Knowledge Distillation for Monocular 3D Object Detection},
author = {Hou-I Liu and Christine Wu and Jen-Hao Cheng and Wenhao Chai and Shian-Yun Wang and Gaowen Liu and Hugo Latapie and Jhih-Ciang Wu and Jenq-Neng Hwang and Hong-Han Shuai and Wen-Huang Cheng},
journal= {arXiv preprint arXiv:2404.04910},
year = {2025}
}
备注
Accepted by CVPR 2025. Our code is available at https://github.com/hoiliu-0801/MonoTAKD