DIFF-MF:一种用于多模态图像融合的差异驱动通道-空间状态空间模型
计算机视觉与模式识别
2026-01-12 v1
摘要
多模态图像融合旨在整合来自多个源图像的互补信息,以生成内容丰富的高质量融合图像。尽管基于状态空间模型的现有方法在保持高计算效率的同时取得了令人满意的性能,但它们往往要么以牺牲可见光细节为代价过度优先考虑红外强度,要么相反,在保留可见光结构的同时削弱了热目标的显著性。为了克服这些挑战,我们提出了DIFF-MF,一种新颖的差异驱动通道-空间状态空间模型,用于多模态图像融合。我们的方法利用模态间的特征差异图来指导特征提取,随后在通道和空间两个维度上进行融合过程。在通道维度上,一个通道交换模块通过交叉注意力双状态空间建模增强了通道间的交互,实现了自适应特征重加权。在空间维度上,一个空间交换模块采用跨模态状态空间扫描来实现全面的空间融合。通过高效捕捉全局依赖关系同时保持线性计算复杂度,DIFF-MF有效地整合了互补的多模态特征。在驾驶场景和低空无人机数据集上的实验结果表明,我们的方法在视觉质量和定量评估方面均优于现有方法。
引用
@article{arxiv.2601.05538,
title = {DIFF-MF: A Difference-Driven Channel-Spatial State Space Model for Multi-Modal Image Fusion},
author = {Yiming Sun and Zifan Ye and Qinghua Hu and Pengfei Zhu},
journal= {arXiv preprint arXiv:2601.05538},
year = {2026}
}