通过激活促进与抑制解释对抗样本
计算机视觉与模式识别
2019-10-02 v2 人工智能
摘要
众所周知,卷积神经网络(CNNs)易受对抗样本的攻击:即精心制作的带有难以察觉扰动以欺骗分类器的图像。然而,文献中较少探讨这些扰动的可解释性。本工作旨在更好地理解对抗扰动的作用,并从像素、图像和网络视角提供可视化解释。我们表明对抗样本对神经元激活具有促进-抑制效应(PSE),并可主要归为三类:i)以抑制为主的扰动,主要降低真实标签的分类分数;ii)以促进为主的扰动,专注于提升目标标签的置信度;iii)平衡扰动,在抑制和促进中发挥双重作用。我们还提供了对抗样本在图像层面的可解释性。这将像素级扰动的 PSE 与由类激活映射(Zhou et al. 2016)定位的类别特定判别图像区域联系起来。进一步,我们通过网络剖析(Bau et al. 2017)考察对抗效应,该方法提供了隐藏单元在概念层面的可解释性。我们表明,单元对对抗攻击的敏感性与它们在语义概念上的可解释性之间存在紧密关联。最后,我们从解释中提供了一些新见解,以改进网络的对抗鲁棒性。
引用
@article{arxiv.1904.02057,
title = {Interpreting Adversarial Examples by Activation Promotion and Suppression},
author = {Kaidi Xu and Sijia Liu and Gaoyuan Zhang and Mengshu Sun and Pu Zhao and Quanfu Fan and Chuang Gan and Xue Lin},
journal= {arXiv preprint arXiv:1904.02057},
year = {2019}
}