中文

FSATFusion:用于红外与可见光图像融合的频-空注意力Transformer

计算机视觉与模式识别 2025-06-13 v1

摘要

红外与可见光图像融合(IVIF)因在下游应用中的优异表现而日益受到研究界和工业界的关注。现有的深度学习方法通常利用卷积神经网络提取图像特征。然而,卷积操作本质上捕获全局上下文的能力有限,可能导致信息丢失,从而限制融合性能。为解决这一局限,我们提出了一种端到端融合网络——频-空注意力Transformer融合网络(FSATFusion)。FSATFusion 包含一个频-空注意力Transformer(FSAT)模块,旨在有效从源图像中提取判别性特征。该 FSAT 模块包括一个频-空注意力机制(FSAM),能够从特征图中提取显著特征。此外,我们提出了一种改进的Transformer模块(ITM),以增强标准 Transformer 提取全局上下文信息的能力。我们进行了定性和定量的对比实验,证明了 FSATFusion 相比其他最先进方法在融合质量和效率上的优越性。此外,我们的网络在无需任何修改的情况下在两个额外任务上进行了测试,以验证 FSATFusion 的优异泛化能力。最后,目标检测实验展示了 FSATFusion 在下游视觉任务中的优越性。我们的代码可在 https://github.com/Lmmh058/FSATFusion 获取。

关键词

引用

@article{arxiv.2506.10366,
  title  = {FSATFusion: Frequency-Spatial Attention Transformer for Infrared and Visible Image Fusion},
  author = {Tianpei Zhang and Jufeng Zhao and Yiming Zhu and Guangmang Cui and Yuhan Lyu},
  journal= {arXiv preprint arXiv:2506.10366},
  year   = {2025}
}