中文

MambaDFuse:基于 Mamba 的多模态图像融合双阶段模型

计算机视觉与模式识别 2024-04-15 v1

摘要

多模态图像融合(MMIF)旨在将来自不同模态的互补信息整合到单张融合图像中,以全面表征成像场景并促进下游视觉任务。近年来,得益于深度神经网络的进步,MMIF 任务取得了显著进展。然而,受限于固有的局部归纳偏置(CNN)或二次计算复杂度(Transformers),现有方法无法有效且高效地提取模态特定特征与模态融合特征。为克服这一问题,我们提出了一种基于 Mamba 的双阶段融合(MambaDFuse)模型。首先,设计了一个双层特征提取器,通过从 CNN 和 Mamba 块中提取低层和高层特征,来捕获单模态图像的长程特征。然后,提出了一种双阶段特征融合模块,以获取结合了不同模态互补信息的融合特征。该模块使用通道交换方法进行浅层融合,并使用增强的多模态 Mamba(M3)块进行深度融合。最后,融合图像重建模块利用特征提取的逆变换生成融合结果。通过大量实验,我们的方法在红外-可见光图像融合与医学图像融合中均取得了有前景的融合结果。此外,在统一基准测试中,MambaDFuse 在目标检测等下游任务中也展现出提升的性能。包含检查点的代码将在同行评审过程后提供。

关键词

引用

@article{arxiv.2404.08406,
  title  = {MambaDFuse: A Mamba-based Dual-phase Model for Multi-modality Image Fusion},
  author = {Zhe Li and Haiwei Pan and Kejia Zhang and Yuhua Wang and Fengming Yu},
  journal= {arXiv preprint arXiv:2404.08406},
  year   = {2024}
}