DiffGradCAM: 利用完整模型决策的类激活图以解决未处理的对抗攻击
机器学习
2026-04-10 v4
摘要
类激活映射(CAM)及其基于梯度的变体(如GradCAM)已成为解释卷积神经网络(CNN)预测的标准工具。然而,这些方法通常关注单个logit,而使用softmax的神经网络中,类别成员概率估计仅依赖于logit之间的差异,而非其绝对值。这种脱节使标准CAM容易受到对抗操作的影响,例如被动欺骗——模型被训练为产生误导性CAM而不影响决策性能。为解决这一脆弱性,我们提出DiffGradCAM及其高阶导数版本DiffGradCAM++,作为新型轻量级对比类激活图方法,不受被动欺骗影响,并在非对抗情况下与GradCAM和GradCAM++等标准方法的输出一致。为验证我们的主张,我们引入了显著性-欺骗激活图(SHAMs),一种更高级的、基于熵感知的被动欺骗形式,作为对抗条件下CAM鲁棒性的基准。SHAM和DiffGradCAM共同建立了探测和改进显著性解释鲁棒性的新框架。我们在少类别和多类别任务中验证了两项贡献。
引用
@article{arxiv.2506.08514,
title = {DiffGradCAM: A Class Activation Map Using the Full Model Decision to Solve Unaddressed Adversarial Attacks},
author = {Jacob Piland and Chris Sweet and Adam Czajka},
journal= {arXiv preprint arXiv:2506.08514},
year = {2026}
}