利用以视觉为中心的多模态专长进行3D目标检测
计算机视觉与模式识别
2023-10-25 v1
摘要
当前研究主要致力于通过从基于LiDAR或多模态的对应模型(专家)迁移知识来提升仅相机3D目标检测器(学徒)的精度。然而,LiDAR与相机特征间的域差距,加上时间融合中固有的不兼容性,显著阻碍了基于蒸馏的增强对学徒的有效性。受单模态蒸馏成功的启发,一个对学徒友好的专家模型将主要依赖相机特征,同时仍达到与多模态模型相当的性能。为此,我们引入VCD,一个用于改进仅相机学徒模型的框架,包括一个对学徒友好的多模态专家和时间融合友好的蒸馏监督。多模态专家VCD-E采用与仅相机学徒相同的结构以缓解特征差异,并利用LiDAR输入作为深度先验来重建3D场景,达到与其他异构多模态专家相当的性能。此外,引入一个细粒度基于轨迹的蒸馏模块,旨在单独纠正场景中每个目标的运动错位。借助这些改进,我们的仅相机学徒VCD-A在nuScenes上以63.1% NDS的分数刷新了最优性能。
引用
@article{arxiv.2310.15670,
title = {Leveraging Vision-Centric Multi-Modal Expertise for 3D Object Detection},
author = {Linyan Huang and Zhiqi Li and Chonghao Sima and Wenhai Wang and Jingdong Wang and Yu Qiao and Hongyang Li},
journal= {arXiv preprint arXiv:2310.15670},
year = {2023}
}
备注
Accepted by NeurIPS 2023