基于空间-频率增强 Mamba 的多模态图像融合
计算机视觉与模式识别
2025-11-11 v1
摘要
多模态图像融合 (MMIF) 旨在整合来自不同模态的互补图像信息,以生成信息丰富的图像。以往的深度学习方法通常采用卷积神经网络 (CNN) 或 Transformer 进行特征提取。然而,这些方法由于CNN的感受野有限以及Transformer的高计算成本,表现不佳。最近,Mamba 在以线性复杂度建模长程依赖方面展现了强大的潜力,为MMIF提供了有前景的解决方案。然而,Mamba缺乏完整的空间和频率感知,这在MMIF中至关重要。此外,将图像重建 (IR) 作为辅助任务被证明对MMIF有益。然而,主要挑战在于如何高效有效地利用IR。为解决上述问题,我们提出一种新框架,称为空间-频率增强 Mamba 融合 (SFMFusion),用于MMIF。具体而言,我们提出三分支结构以耦合MMIF和IR,可保留来自源图像的完整内容。随后,我们提出空间-频率增强 Mamba 块 (SFMB),用于在空间和频率域内增强Mamba,以实现全面特征提取。最后,我们提出动态融合 Mamba 块 (DFMB),可在不同分支中部署以实现动态特征融合。大量实验表明,我们的方法在六个MMIF数据集上优于大多数最先进方法。源代码已公开于 https://github.com/SunHui1216/SFMFusion。
引用
@article{arxiv.2511.06593,
title = {Spatial-Frequency Enhanced Mamba for Multi-Modal Image Fusion},
author = {Hui Sun and Long Lv and Pingping Zhang and Tongdan Tang and Feng Tian and Weibing Sun and Huchuan Lu},
journal= {arXiv preprint arXiv:2511.06593},
year = {2025}
}
备注
This work is accepted by IEEE Transactions on Image Processing. More modifications may be performed