中文

RoboFusion:借助SAM实现鲁棒的多模态三维目标检测

计算机视觉与模式识别 2024-04-24 v4

摘要

多模态三维目标检测器致力于为自动驾驶(AD)探索安全可靠的感知系统。尽管在干净的基准数据集上达到了当前最优(SOTA)性能,但它们往往忽视了真实世界环境的复杂性和严苛条件。随着视觉基础模型(VFMs)的出现,为提升自动驾驶中多模态三维目标检测的鲁棒性和泛化能力带来了机遇与挑战。为此,我们提出了RoboFusion,一个利用SAM等视觉基础模型来应对分布外(OOD)噪声场景的鲁棒框架。我们首先将原始SAM适配于自动驾驶场景,命名为SAM-AD。为了将SAM或SAM-AD与多模态方法对齐,我们随后引入了AD-FPN,用于对SAM提取的图像特征进行上采样。我们采用小波分解对深度引导图像进行去噪,以进一步降低噪声和天气干扰。最后,我们利用自注意力机制自适应地重新加权融合后的特征,增强信息性特征的同时抑制过量噪声。总之,RoboFusion通过利用视觉基础模型的泛化性和鲁棒性显著降低了噪声,从而增强了多模态三维目标检测的韧性。因此,RoboFusion在噪声场景下实现了SOTA性能,这一点在KITTI-C和nuScenes-C基准上得到了验证。代码可在https://github.com/adept-thu/RoboFusion获取。

关键词

引用

@article{arxiv.2401.03907,
  title  = {RoboFusion: Towards Robust Multi-Modal 3D Object Detection via SAM},
  author = {Ziying Song and Guoxing Zhang and Lin Liu and Lei Yang and Shaoqing Xu and Caiyan Jia and Feiyang Jia and Li Wang},
  journal= {arXiv preprint arXiv:2401.03907},
  year   = {2024}
}