中文

基于通道扰动和预训练知识集成的统一多模态图像融合

计算机视觉与模式识别 2025-11-18 v1

摘要

多模态图像融合通过组合互补信息来增强场景感知。统一模型旨在跨模态共享参数以实现多模态图像融合,但大幅模态差异常导致梯度冲突,限制了性能。某些方法引入模态特定编码器以增强特征感知并提升融合质量。然而,这种策略会降低对不同融合任务的泛化能力。为克服这一限制,我们提出一种基于通道扰动和预训练知识集成的统一多模态图像融合框架(UP-Fusion)。为抑制冗余模态信息并突出关键特征,我们提出语义感知通道裁剪模块(SCPM),利用预训练模型的语义感知能力对多模态特征通道进行筛选和增强。此外,我们提出了几何仿射调制模块(GAM),使用原始模态特征对初始融合特征施加仿射变换,以保持特征编码器的模态判别性。最后,我们在解码器中应用文本引导通道扰动模块(TCPM),以重塑通道分布,减少对模态特定通道的依赖。广泛实验表明,所提出的方法在多模态图像融合及下游任务方面均优于现有方法。

关键词

引用

@article{arxiv.2511.12432,
  title  = {Text-Guided Channel Perturbation and Pretrained Knowledge Integration for Unified Multi-Modality Image Fusion},
  author = {Xilai Li and Xiaosong Li and Weijun Jiang},
  journal= {arXiv preprint arXiv:2511.12432},
  year   = {2025}
}

备注

Accepted at AAAI 2026