中文

基于归因分析的深度展开多模态图像融合网络

计算机视觉与模式识别 2025-02-04 v1

摘要

多模态图像融合将来自多个来源的信息合成为单一图像,促进语义分割等下游任务。当前方法主要致力于通过复杂映射获取在视觉显示层次上具有信息丰富性的融合图像。虽然有些方法试图联合优化图像融合和下游任务,但这些努力往往缺乏直接的指导或交互,仅 serve 为预定义融合损失的辅助。为此,我们提出了“展开归因分析融合网络”(UAAFusion),利用归因分析技术更有效地为语义分割定制融合图像,增强融合与分割之间的交互。具体而言,我们利用归因分析技术探索源图像中语义区域对任务判别的贡献。同时,我们的融合算法整合了来自源图像的更多有益特征,从而允许分割指导融合过程。我们的 method 构建了一个基于归因分析推导的优化目标的模型驱动展开网络,计算由当前分割网络状态决定的归因融合损失。我们还开发了一种专为本展开网络中的融合任务量身定制的新型路径函数。在每个网络阶段集成了归因注意力机制,使融合网络能够优先考虑对高层识别任务至关重要的区域和像素。此外,为缓解传统展开网络中的信息损失,我们在网络中引入了记忆增强模块,以提高跨不同网络层的信息流。大量实验表明,我们的方法在图像融合和语义分割方面具有优势。

关键词

引用

@article{arxiv.2502.01467,
  title  = {Deep Unfolding Multi-modal Image Fusion Network via Attribution Analysis},
  author = {Haowen Bai and Zixiang Zhao and Jiangshe Zhang and Baisong Jiang and Lilun Deng and Yukun Cui and Shuang Xu and Chunxia Zhang},
  journal= {arXiv preprint arXiv:2502.01467},
  year   = {2025}
}

备注

Accepted in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT) 2024