单目3D目标检测的跨模态蒸馏选择性迁移学习
计算机视觉与模式识别
2026-03-10 v1
摘要
单目3D目标检测因缺乏准确深度信息而呈现出潜在且难以解决的任务。跨模态知识蒸馏可有效将LiDAR中的深度信息传递至基于图像的网络,但模态间的差距严重限制了其精度。本文首次系统性地探讨了跨模态蒸馏中由模态差距引发的负迁移问题,包括不仅架构不一致问题,更重要的是特征过拟合问题。我们提出一种名为 MonoSTL 的选择性学习方法以克服上述问题,旨在鼓励来自LiDAR的深度信息实现正向迁移,同时缓解基于图像的网络的负向迁移。一方面,我们利用相似的网络架构确保基于图像与LiDAR的网络特征在空间上对齐。另一方面,我们开发了两种新型蒸馏模块,即深度感知选择性特征蒸馏(DASFD)与深度感知选择性关系蒸馏(DASRD),通过整合深度不确定性分别于特征与关系蒸馏中选择性地学习物体的正向特征与关系。我们的做法可无缝集成到各种基于CNN的模型与DETR-based模型中,本文选取三个在KITTI 数据集上最新模型以及一个在NuScenes 数据集上最新模型进行验证。大量实验表明,我们的方法显著提升了基线模型的精度,从而实现了与所有最新发布的SOTA模型相比的最佳精度。
引用
@article{arxiv.2603.07464,
title = {Selective Transfer Learning of Cross-Modality Distillation for Monocular 3D Object Detection},
author = {Rui Ding and Meng Yang and Nanning Zheng},
journal= {arXiv preprint arXiv:2603.07464},
year = {2026}
}