中文

MMA-UNet:一种用于红外与可见光图像融合的多模态非对称 UNet 架构

计算机视觉与模式识别 2024-07-12 v2

摘要

多模态图像融合 (MMIF) 将来自各种模态的有用信息映射到同一表示空间中,从而生成信息丰富的融合图像。然而,现有的融合算法倾向于对称地融合多模态图像,这会导致浅层信息丢失或在融合结果的某些区域偏向于单一模态。在本研究中,我们分析了不同模态中信息的空间分布差异,并证明了在同一网络内编码特征不利于实现多模态图像的深度特征空间对齐。为克服这一问题,我们提出了一种多模态非对称 UNet (MMA-UNet)。我们为不同模态分别训练了专门的编码器,并实现了跨尺度融合策略,以将不同模态的特征保持在同一表示空间中,从而确保均衡的信息融合过程。此外,我们进行了广泛的融合与下游任务实验,证明了 MMA-UNet 在融合红外与可见光图像信息方面的有效性,生成了视觉自然且语义丰富的融合结果。其性能超越了 state-of-the-art 的对比融合方法。

关键词

引用

@article{arxiv.2404.17747,
  title  = {MMA-UNet: A Multi-Modal Asymmetric UNet Architecture for Infrared and Visible Image Fusion},
  author = {Jingxue Huang and Xilai Li and Tianshu Tan and Xiaosong Li and Tao Ye},
  journal= {arXiv preprint arXiv:2404.17747},
  year   = {2024}
}