FusionMamba:基于 Mamba 的多模态图像融合动态特征增强
计算机视觉与模式识别
2025-02-04 v3
摘要
多模态图像融合旨在整合来自不同成像技术的信息,为下游视觉任务生成一张全面、细节丰富的单一图像。基于局部卷积神经网络 (CNN) 的现有方法难以高效捕获全局特征,而基于 Transformer 的模型虽然擅长全局建模,但计算成本高昂。Mamba 通过利用选择性结构化状态空间模型 (S4) 来有效处理长距离依赖,同时保持线性复杂度,从而解决了这些局限性。在本文中,我们提出了 FusionMamba,一种新颖的动态特征增强框架,旨在克服 CNN 和视觉 Transformer (ViT) 在计算机视觉任务中面临的挑战。该框架通过集成动态卷积和通道注意力机制改进了视觉状态空间模型 Mamba,这不仅保留了其强大的全局特征建模能力,还大大减少了冗余并增强了局部特征的表现力。此外,我们开发了一个名为动态特征融合模块 (DFFM) 的新模块。它结合了用于纹理增强和差异感知的动态特征增强模块 (DFEM) 与专注于增强模态间相关性同时抑制冗余信息的跨模态融合 Mamba 模块 (CMFM)。实验表明,FusionMamba 在多种多模态图像融合任务以及下游实验中均取得了 SOTA 性能,证明了其广泛的适用性和优越性。
引用
@article{arxiv.2404.09498,
title = {FusionMamba: Dynamic Feature Enhancement for Multimodal Image Fusion with Mamba},
author = {Xinyu Xie and Yawen Cui and Tao Tan and Xubin Zheng and Zitong Yu},
journal= {arXiv preprint arXiv:2404.09498},
year = {2025}
}
备注
Accepted by Visual Intelligence. Codes are at https://github.com/millieXie/FusionMamba