中文

面向多模态图像融合的任务通用自适应跨域学习

计算机视觉与模式识别 2025-08-22 v1

摘要

多模态图像融合(MMIF)旨在整合来自不同成像模态的互补信息,以克服单个传感器的局限性。它提升图像质量,并促进遥感、医疗诊断和机器人等下游应用的实现。尽管取得了显著进展,当前的 MMIF 方法仍面临模态错位、高频细节丢失和任务特定限制等挑战。为此,我们提出 AdaSFFuse—a 一种通过自适应跨域共融合学习实现任务通用 MMIF 的新型框架。AdaSFFuse 引入两个关键创新:用于频率解耦的自适应近似小波变换(AdaWAT),以及用于高效多模态融合的空间-频率 Mamba 块。AdaWAT 可适应性地分离来自不同场景中不同模态图像的高频和低频成分,实现对每个模态的细粒度特征提取与对齐。空间-频率 Mamba 块支持在空间和频率域之间进行跨域融合,从而提升这一过程。这些块通过可学习的映射动态调整,以确保跨模态的稳健融合。通过组合这些组件,AdaSFFuse 改进了多模态特征的对齐和集成,减少频率损失,保留关键细节。在四项 MMIF 任务——红外-可见图像融合(IVF)、多焦点图像融合(MFF)、多曝光图像融合(MEF)和医疗图像融合(MIF)——上的大量实验表明,AdaSFFuse 在融合性能方面表现卓越,同时保持低计算成本和紧凑网络结构,在性能与效率之间实现了强大的平衡。代码将在 https://github.com/Zhen-yu-Liu/AdaSFFuse 上公开。

关键词

引用

@article{arxiv.2508.15505,
  title  = {Task-Generalized Adaptive Cross-Domain Learning for Multimodal Image Fusion},
  author = {Mengyu Wang and Zhenyu Liu and Kun Li and Yu Wang and Yuwei Wang and Yanyan Wei and Fei Wang},
  journal= {arXiv preprint arXiv:2508.15505},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Multimedia