基于模块无关解码与邻近性模块集成的鲁棒多模态 3D 目标检测
计算机视觉与模式识别
2024-08-20 v2
摘要
最近的 3D 目标检测进步得益于来自多视图摄像头和激光雷达传感器的多模态信息。然而,不同模态之间的固有差异仍然是主要挑战。我们发现,现有的多模态 3D 目标检测方法高度依赖激光雷达传感器,将摄像头视为增强语义细节的辅助模态。这往往导致不仅 underutilize 摄像头数据,而且在激光雷达数据不可用时性能显著下降。此外,现有融合方法忽略了由环境变化引起的传感器噪声对检测性能的负面影响。本文提出了 MEFormer 方法,解决激光雷达过度依赖问题,同时充分利用所有可用模态的关键信息,并在融合过程中抵御受损信号。具体而言,我们引入模块无关解码 (MOAD),该方法无论输入模态如何,都通过共享 transformer 解码器提取几何和语义特征,并在单模态和多模态情境下均能提供显著改进。此外,我们的邻近性模块集成 (PME) 模块能够根据环境情况自适应地利用各模态的优势,同时减轻噪声传感器的影响。我们的 MEFormer 在 nuScenes 验证集上实现了 73.9% 的 NDS 和 71.5% 的 mAP,达到最先进水平。广泛的分析表明,MEFormer 在传感器故障或环境变化等具挑战性条件下具有更好的鲁棒性。源代码已公开:https://github.com/hanchaa/MEFormer
关键词
引用
@article{arxiv.2407.19156,
title = {Robust Multimodal 3D Object Detection via Modality-Agnostic Decoding and Proximity-based Modality Ensemble},
author = {Juhan Cha and Minseok Joo and Jihwan Park and Sanghyeok Lee and Injae Kim and Hyunwoo J. Kim},
journal= {arXiv preprint arXiv:2407.19156},
year = {2024}
}