一种用于图像融合的局部增强与状态共享新型状态空间模型
计算机视觉与模式识别
2024-08-22 v2
摘要
在图像融合任务中,来自不同源的图像具有不同的特性。这推动了许多方法的发展,以探索在保留各自特性的同时更好地融合它们。Mamba作为一种状态空间模型,已在自然语言处理领域崭露头角。最近,许多研究尝试将Mamba扩展到视觉任务。然而,由于图像的特性不同于因果语言序列,Mamba有限的状态容量削弱了其对图像信息建模的能力。此外,Mamba的序列建模能力仅能处理空间信息,无法有效捕捉图像中丰富的光谱信息。受这些挑战的启发,我们定制并改进了为图像融合任务设计的视觉Mamba网络。具体来说,我们提出了局部增强视觉Mamba块,称为LEVM。LEVM块可以改善网络的局部信息感知能力,并同时学习局部和全局空间信息。此外,我们提出了状态共享技术,以增强空间细节并整合空间和光谱信息。最终,整个网络是一个基于视觉Mamba的多尺度结构,称为LE-Mamba。大量实验表明,所提出的方法在多光谱全色锐化以及多光谱与高光谱图像融合数据集上取得了最先进的结果,并证明了所提方法的有效性。代码可在\url{https://github.com/294coder/Efficient-MIF}获取。
引用
@article{arxiv.2404.09293,
title = {A Novel State Space Model with Local Enhancement and State Sharing for Image Fusion},
author = {Zihan Cao and Xiao Wu and Liang-Jian Deng and Yu Zhong},
journal= {arXiv preprint arXiv:2404.09293},
year = {2024}
}