结构化对抗攻击:面向通用实现与更好可解释性
机器学习
2019-02-21 v3 人工智能
机器学习
摘要
在生成对抗样本以攻击深度神经网络(DNNs)时,通常利用所加扰动的 Lp 范数来衡量原始图像与对抗样本之间的相似性。然而,这种扰动原始输入空间的对抗攻击可能无法捕捉输入中隐藏的结构信息。本文提出了一种更通用的攻击模型,即结构化攻击(StrAttack),其通过对图像滑动掩码以提取关键空间结构,从而探索对抗扰动中的组稀疏性。我们提出了一种基于 ADMM(交替方向乘子法)的框架,该框架可将原问题拆分为一系列可解析求解的子问题,并可推广用于实现其他攻击方法。即使在 Lp 范数失真程度与最先进攻击相同的情况下,对抗扰动中也能实现强组稀疏性。我们在 MNIST、CIFAR-10 和 ImageNet 上的大量实验结果证明了 StrAttack 的有效性。我们还通过对抗显著图(Papernot et al., 2016b)和类激活图(Zhou et al., 2016)表明,StrAttack 提供了更好的可解释性(即与判别性图像区域更好的对应性)。
引用
@article{arxiv.1808.01664,
title = {Structured Adversarial Attack: Towards General Implementation and Better Interpretability},
author = {Kaidi Xu and Sijia Liu and Pu Zhao and Pin-Yu Chen and Huan Zhang and Quanfu Fan and Deniz Erdogmus and Yanzhi Wang and Xue Lin},
journal= {arXiv preprint arXiv:1808.01664},
year = {2019}
}
备注
Published as a conference paper at ICLR 2019