Fusion-CAM:用于稳健视觉解释的梯度和区域基类激活图的融合
计算机视觉与模式识别
2026-03-06 v1
摘要
解释深度卷积神经网络决策过程仍是实现可信赖和透明人工智能的核心挑战。解释性人工智能(XAI)技术,特别是类激活图(CAM)方法,广泛用于可视化影响模型预测的输入区域。梯度基方法(如 Grad-CAM)通过计算类激活的梯度提供高度判别性、细粒度细节,但常产生噪声和不完整的图,仅强调最突出的区域而非完整对象。区域基方法(如 Score-CAM)在更大区域上聚合信息,捕获更广泛的对象覆盖,但会出现平滑化并对细微特征敏感性降低。我们引入 Fusion-CAM,一种新型框架通过专用融合机制统一这两种范式,产生稳健且高度判别性的视觉解释。该方法首先对梯度基图进行去噪,得到更干净、更聚焦的激活。随后将优化后的梯度图与区域基图结合,使用贡献权重增强类覆盖。最后,我们提出基于相似性的自适应像素级融合,评估两种范式间的一致性并动态调整融合强度。这种自适应机制强化一致激活,同时柔和地混合冲突区域,产生更丰富、更具情境感知且具有输入适应性的视觉解释。大量实验表明,Fusion-CAM 在定性可视化和定量评估方面均 consistently 优于现有 CAM 变体,为解释深度神经网络提供了稳健且灵活的工具。
引用
@article{arxiv.2603.05386,
title = {Fusion-CAM: Integrating Gradient and Region-Based Class Activation Maps for Robust Visual Explanations},
author = {Hajar Dekdegue and Moncef Garouani and Josiane Mothe and Jordan Bernigaud},
journal= {arXiv preprint arXiv:2603.05386},
year = {2026}
}