MambaFusion:用于多模态3D目标检测的高度保真密集全局融合
计算机视觉与模式识别
2025-07-08 v1
摘要
我们提出首个展示纯 Mamba 块可实现高效密集全局融合,并为相机-LiDAR 多模态3D目标检测保证顶级性能的工作。我们的动机源于观察到,现有融合策略受限于无法同时实现效率、长程建模和保留完整场景信息。受最新进展(状态空间模型和线性注意力)的启发,我们利用其线性复杂度和长程建模能力以解决这些挑战。然而,这并非易事,因为我们的实验表明,仅采用高效线性复杂度方法并不一定带来改进,甚至可能导致性能下降。我们将这种下降归因于在多模态对齐过程中丢失了高度信息,导致序列顺序偏差。为解决此问题,我们提出了通过连续空间中的体素压缩保留精确高度信息的高度保真 LiDAR 编码,从而增强相机-LiDAR 对齐。随后,我们引入混合 Mamba 块,利用所获高度感知特征进行局部和全局上下文学习。通过整合这些组件,我们的方法在 nuScenes 验证基准上以 75.0 的顶级 NDS 分数实现了最先进的性能,甚至超过了使用高分辨率输入的方法。同时,我们的方法保持了效率,推理速度快于大多数最新最先进的方法。
引用
@article{arxiv.2507.04369,
title = {MambaFusion: Height-Fidelity Dense Global Fusion for Multi-modal 3D Object Detection},
author = {Hanshi Wang and Jin Gao and Weiming Hu and Zhipeng Zhang},
journal= {arXiv preprint arXiv:2507.04369},
year = {2025}
}
备注
10 pages