中文

用Grad-CAM推广对抗解释

计算机视觉与模式识别 2022-04-13 v1 密码学与安全

摘要

梯度加权类激活映射(Grad-CAM)是一种基于样本的解释方法,为卷积神经网络(CNN)模型提供梯度激活热力图作为解释。该方法的缺陷在于无法用于推广CNN的行为。本文提出一种新方法,将Grad-CAM从基于样本的解释扩展为解释全局模型行为的方法。这是通过引入两个新指标实现的:(i)平均观测差异度(MOD)与(ii)差异度变异(VID),用于模型推广。这些指标通过比较原始测试集样本与对抗测试集样本的Grad-CAM生成热力图的归一化反转结构相似性指数(NISSIM)计算得出。实验中,我们研究了深度模型(如VGG16、ResNet50和ResNet101)与宽模型(如InceptionNetv3和XceptionNet)在快速梯度符号法(FGSM)下的对抗攻击。随后,我们利用VGGFace2数据集在自动人脸识别(AFR)用例上计算MOD与VID指标。我们观察到,在所有模型遭受对抗攻击时,Grad-CAM热力图中高亮区域(反映其对决策的贡献)发生了一致性偏移。所提方法可用于理解对抗攻击并解释黑盒CNN模型在图像分析中的行为。

关键词

引用

@article{arxiv.2204.05427,
  title  = {Generalizing Adversarial Explanations with Grad-CAM},
  author = {Tanmay Chakraborty and Utkarsh Trehan and Khawla Mallat and Jean-Luc Dugelay},
  journal= {arXiv preprint arXiv:2204.05427},
  year   = {2022}
}

备注

Accepted in CVPRw ArtofRobustness workshop