理解与诊断对抗攻击下的脆弱性
计算机视觉与模式识别
2020-07-20 v1 机器学习
摘要
深度神经网络(DNNs)已知易受对抗攻击。目前,对于微小的扰动如何导致分类结果出现如此大的差异,以及我们如何设计更鲁棒的模型架构,尚缺乏清晰的见解。在本工作中,我们提出一种新颖的可解释性方法 InterpretGAN,用于生成潜变量中用于分类的特征的解释。解释对抗样本的分类过程揭示了对抗扰动如何逐层影响特征,以及哪些特征被扰动所修改。此外,我们设计了首个诊断方法,用于量化每一层所贡献的脆弱性,该方法可用于识别模型架构中的脆弱部分。诊断结果表明,引入更多信息损失的层往往比其他层更脆弱。基于这些发现,我们在 MNIST 和 CIFAR10 数据集上的评估结果表明,对于本文所研究的网络架构,具有较低信息损失的平均池化层比最大池化层更鲁棒。
引用
@article{arxiv.2007.08716,
title = {Understanding and Diagnosing Vulnerability under Adversarial Attacks},
author = {Haizhong Zheng and Ziqi Zhang and Honglak Lee and Atul Prakash},
journal= {arXiv preprint arXiv:2007.08716},
year = {2020}
}