中文

为何 Mamba 有效?利用线性 Transformer-Mamba 网络进行多模态图像融合

计算机视觉与模式识别 2024-09-06 v1

摘要

多模态图像融合旨在整合来自不同来源图像的优点,并生成高质量的融合图像。然而,现有的特征提取与融合方法要么受限于固有的局部归纳偏置及推理过程中的静态参数(CNN),要么受限于二次计算复杂度(Transformers),无法有效提取和融合特征。为解决这一问题,我们提出了一种名为 Tmamba 的双分支图像融合网络。它由线性 Transformer 和 Mamba 组成,在保持线性复杂度的同时具备全局建模能力。由于 Transformer 和 Mamba 结构之间的差异,两个分支提取的特征分别携带通道信息和位置信息。我们在两个分支之间设计了 T-M 交互结构,分别使用全局可学习参数和卷积层来传递位置和通道信息。我们进一步在注意力层面提出跨模态交互,以获取跨模态注意力。实验表明,我们的 Tmamba 在包括红外-可见光图像融合和医学图像融合在内的多个融合任务中取得了优异的结果。带有检查点的代码将在同行评审过程后提供。

关键词

引用

@article{arxiv.2409.03223,
  title  = {Why mamba is effective? Exploit Linear Transformer-Mamba Network for Multi-Modality Image Fusion},
  author = {Chenguang Zhu and Shan Gao and Huafeng Chen and Guangqian Guo and Chaowei Wang and Yaoxing Wang and Chen Shu Lei and Quanjiang Fan},
  journal= {arXiv preprint arXiv:2409.03223},
  year   = {2024}
}