GrFormer:基于Grassmann流形的红外和可见图像融合Transformer
计算机视觉与模式识别
2025-06-18 v1
摘要
在图像融合领域,已取得了通过将不同模态的数据建模为线性子空间来实现图像融合的显著进展。然而,实际情况下,源图像常位于非欧几里得空间,欧几里得方法通常无法封装其内在拓扑结构。通常情况下,在欧几里得空间中执行的内积计算的是代数相似性,而非语义相似性,这会导致不理想的注意力输出并降低融合性能。在红外和可见图像融合任务中,应考虑低层细节与高层语义之间的平衡。为此,本文提出一种基于Grassmann流形的注意力机制,用于红外和可见图像融合(GrFormer)。具体而言,我们的方法通过在Grassmann流形上施加投影约束构建低秩子空间映射,将注意力特征压缩到不同秩水平的子空间中。这迫使特征解耦为高频细节(局部低秩)和低频语义(全局低秩),从而实现多尺度语义融合。此外,为有效整合显著信息,我们开发了基于协方差掩码的跨模态融合策略(CMS),以最大化不同模态之间的互补属性,并抑制被视为冗余的高相关特征。实验结果表明,该网络在多个图像融合基准数据集上在定性和定量方面均优于SOTA方法。代码已公开于https://github.com/Shaoyun2023。
引用
@article{arxiv.2506.14384,
title = {GrFormer: A Novel Transformer on Grassmann Manifold for Infrared and Visible Image Fusion},
author = {Huan Kang and Hui Li and Xiao-Jun Wu and Tianyang Xu and Rui Wang and Chunyang Cheng and Josef Kittler},
journal= {arXiv preprint arXiv:2506.14384},
year = {2025}
}
备注
16 pages, 11 figures