S4Fusion:面向红外与可见光图像融合的显著性感知选择性状态空间模型
计算机视觉与模式识别
2025-06-24 v3
摘要
作为图像融合任务之一,红外与可见光图像融合旨在将不同模态传感器捕获的互补信息整合到单一图像中。选择性状态空间模型(SSSM)以其捕获长程依赖的能力而闻名,已在计算机视觉领域展现出潜力。然而,在图像融合中,当前方法低估了SSSM在捕获两种模态全局空间信息方面的潜力。这种局限性使得在交互过程中无法同时考虑两种模态的全局空间信息,导致对显著性目标的感知不全面。因此,融合结果倾向于偏向一种模态,而非自适应地保留显著性目标。为解决此问题,我们提出了显著性感知选择性状态空间融合模型(S4Fusion)。在我们的S4Fusion中,设计的跨模态空间感知模块(CMSA)能够同时关注两种模态的全局空间信息并促进其交互,从而全面捕获互补信息。此外,S4Fusion利用预训练网络感知融合图像中的不确定性。通过最小化这种不确定性,S4Fusion自适应地突出显示来自两幅图像的显著性目标。大量实验表明,我们的方法能生成高质量图像并提升下游任务的性能。
引用
@article{arxiv.2405.20881,
title = {S4Fusion: Saliency-aware Selective State Space Model for Infrared Visible Image Fusion},
author = {Haolong Ma and Hui Li and Chunyang Cheng and Gaoang Wang and Xiaoning Song and Xiaojun Wu},
journal= {arXiv preprint arXiv:2405.20881},
year = {2025}
}