基于混合 CNN-Transformer 与非局部跨模态注意力的多模态图像融合
计算机视觉与模式识别
2022-10-19 v1
摘要
由异质传感器所拍摄图像的融合有助于丰富信息并提升成像质量。本文中,我们提出一种由卷积编码器与基于 Transformer 的解码器组成的混合模型以融合多模态图像。在编码器中,提出非局部跨模态注意力模块以捕获多幅源图像的局部与全局依赖关系。设计分支融合模块以自适应融合两分支的特征。我们在解码器中嵌入具有线性复杂度的 Transformer 模块,以增强所提网络的重建能力。通过与现有最先进融合模型的比较,定性与定量实验证明了所提方法的有效性。我们的工作源代码见 https://github.com/pandayuanyu/HCFusion。
引用
@article{arxiv.2210.09847,
title = {Multimodal Image Fusion based on Hybrid CNN-Transformer and Non-local Cross-modal Attention},
author = {Yu Yuan and Jiaqi Wu and Zhongliang Jing and Henry Leung and Han Pan},
journal= {arXiv preprint arXiv:2210.09847},
year = {2022}
}