MATCNN:基于多尺度 CNN 与注意力 Transformer 的红外与可见光图像融合方法
计算机视觉与模式识别
2025-02-05 v1
摘要
尽管基于注意力的方法在增强图像融合和应对长程特征依赖挑战方面取得了显著进展,但由于缺乏多样化的感受野提取技术,其在捕获局部特征方面的有效性受到影响。为克服现有融合方法在提取多尺度局部特征和保留全局特征方面的不足,本文提出了一种基于多尺度卷积神经网络与注意力 Transformer (MATCNN) 的新型跨模态图像融合方法。MATCNN 利用多尺度融合模块 (MSFM) 提取不同尺度的局部特征,并采用全局特征提取模块 (GFEM) 提取全局特征。将两者结合可减少细节特征的损失,并提高全局特征表示能力。同时,使用信息掩码标记图像中的相关细节,旨在提高融合图像中红外图像显著信息和可见光图像背景纹理的保留比例。随后,开发了一种新颖的优化算法,通过整合内容损失、结构相似性指数测量损失和全局特征损失,利用掩码引导特征提取。在多个数据集上进行的定量和定性评估表明,MATCNN 能有效突出红外显著目标,保留可见光图像中的更多细节,并在跨模态图像上取得更优的融合效果。MATCNN 的代码将发布于 https://github.com/zhang3849/MATCNN.git。
引用
@article{arxiv.2502.01959,
title = {MATCNN: Infrared and Visible Image Fusion Method Based on Multi-scale CNN with Attention Transformer},
author = {Jingjing Liu and Li Zhang and Xiaoyang Zeng and Wanquan Liu and Jianhua Zhang},
journal= {arXiv preprint arXiv:2502.01959},
year = {2025}
}