X$^3$KD:面向多相机三维目标检测的跨模态、跨任务与跨阶段知识蒸馏
计算机视觉与模式识别
2023-03-07 v1 机器人学
摘要
近期三维目标检测(3DOD)的进展在基于 LiDAR 的模型中取得了极为强劲的结果。相比之下,基于多相机图像的环视 3DOD 模型表现较差,因为需要将特征从透视视图(PV)变换到 3D 世界表示,而由于缺失深度信息,该变换存在歧义。本文提出 XKD,一个面向多相机 3DOD、跨不同模态、任务和阶段的综合知识蒸馏框架。具体而言,我们在 PV 特征提取阶段提出来自实例分割教师模型(X-IS)的跨任务蒸馏,避免通过视图变换进行有歧义的错误反向传播提供监督。变换之后,我们应用跨模态特征蒸馏(X-FD)和对抗训练(X-AT),通过基于 LiDAR 的 3DOD 教师模型所含信息改善多相机特征的 3D 世界表示。最后,我们还使用该教师模型进行跨模态输出蒸馏(X-OD),在预测阶段提供密集监督。我们对多相机 3DOD 不同阶段的知蒸馏进行了充分消融实验。我们最终的 XKD 模型在 nuScenes 和 Waymo 数据集上优于先前最先进方法,并可泛化至基于 RADAR 的 3DOD。定性结果视频见 https://youtu.be/1do9DPFmr38。
引用
@article{arxiv.2303.02203,
title = {X$^3$KD: Knowledge Distillation Across Modalities, Tasks and Stages for Multi-Camera 3D Object Detection},
author = {Marvin Klingner and Shubhankar Borse and Varun Ravi Kumar and Behnaz Rezaei and Venkatraman Narayanan and Senthil Yogamani and Fatih Porikli},
journal= {arXiv preprint arXiv:2303.02203},
year = {2023}
}
备注
Accepted to CVPR 2023