中文

Fusion-Mamba: 用于跨模态目标检测的融合Mamba

计算机视觉与模式识别 2025-07-23 v1 人工智能

摘要

跨模态融合来自不同模态的互补信息有效提高了目标检测性能,使其在更广泛的应用中更加有用和鲁棒。现有的融合策略通过精心设计的神经网络模块组合不同类型的图像或合并不同的骨干特征。然而,这些方法忽略了模态差异会影响跨模态融合性能,因为不同模态具有不同的相机焦距、位置和角度,很难融合。在本文中,我们通过基于改进的Mamba和门控机制在隐藏状态空间中关联跨模态特征来研究跨模态融合。我们设计了一个Fusion-Mamba块,将跨模态特征映射到隐藏状态空间中进行交互,从而减少跨模态特征之间的差异,增强融合特征的表示一致性。Fusion-Mamba块包含两个模块:状态空间通道交换模块促进浅层特征融合,双状态空间融合模块在隐藏状态空间中实现深层融合。通过在公共数据集上的大量实验,我们提出的方法在M3FDM^3FD数据集上mmAP提升了5.9%,在FLIR-Aligned数据集上提升了4.9%,优于现有最先进方法,展示了卓越的目标检测性能。据我们所知,这是第一个探索Mamba在跨模态融合中潜力的工作,并为跨模态目标检测建立了新的基线。

关键词

引用

@article{arxiv.2404.09146,
  title  = {Fusion-Mamba for Cross-modality Object Detection},
  author = {Wenhao Dong and Haodong Zhu and Shaohui Lin and Xiaoyan Luo and Yunhang Shen and Xuhui Liu and Juan Zhang and Guodong Guo and Baochang Zhang},
  journal= {arXiv preprint arXiv:2404.09146},
  year   = {2025}
}