中文

TransFuse:一种基于Transformer并使用自监督学习的统一图像融合框架

计算机视觉与模式识别 2022-01-20 v1

摘要

图像融合是一种将多幅具有互补信息的源图像进行信息整合以提升单幅图像丰富度的技术。由于任务特定的训练数据及相应真值不足,现有多数端到端图像融合方法易陷入过拟合或繁琐的参数优化过程。两阶段方法通过在大型自然图像数据集上训练编码器-解码器网络并利用提取特征进行融合,避免了对大量任务特定训练数据的需求,但自然图像与不同融合任务间的域差距导致性能受限。本研究设计了一种新颖的基于编码器-解码器的图像融合框架,并提出一种基于破坏-重建的自监督训练方案,以促使网络学习任务特定特征。具体而言,我们分别基于像素强度非线性变换、亮度变换与噪声变换,为多模态图像融合、多曝光图像融合与多聚焦图像融合提出了三种破坏-重建自监督辅助任务。为促使不同融合任务相互促进并提升训练网络的泛化性,我们将这三种自监督辅助任务集成,在模型训练中随机选取其一对自然图像进行破坏。此外,我们设计了一种结合CNN与Transformer的新编码器用于特征提取,使训练模型能同时利用局部与全局信息。在多模态图像融合、多曝光图像融合与多聚焦图像融合任务上的大量实验表明,所提方法在主观与客观评价中均达到了最先进(state-of-the-art, SOTA)性能。代码将很快公开。

关键词

引用

@article{arxiv.2201.07451,
  title  = {TransFuse: A Unified Transformer-based Image Fusion Framework using Self-supervised Learning},
  author = {Linhao Qu and Shaolei Liu and Manning Wang and Shiman Li and Siqi Yin and Qin Qiao and Zhijian Song},
  journal= {arXiv preprint arXiv:2201.07451},
  year   = {2022}
}