面向对抗攻击下深度神经网络加固的防御性 Dropout
密码学与安全
2018-09-17 v1 计算机视觉与模式识别
机器学习
机器学习
摘要
深度神经网络(DNNs)已知易受对抗攻击。即,通过在原始合法输入上添加精心构造的失真所获得的对抗样本,可误导 DNN 将其分类为任意目标标签。本工作提供了一种通过防御性 dropout 加固对抗攻击下 DNNs 的方案。除在训练中使用 dropout 以获得最佳测试精度外,我们提出在测试时也使用 dropout 以实现强防御效果。我们将构建鲁棒 DNNs 的问题视为攻击者—防御者二人博弈,其中攻击者与防御者知晓彼此策略并试图优化自身策略以达均衡。基于对测试 dropout 率对测试精度与攻击成功率影响的观察,我们提出一种防御性 dropout 算法,在给定神经网络模型及攻击者生成对抗样本策略下确定最优测试 dropout 率。我们还探究了所提防御性 dropout 实现出色防御效果背后的机制。与另一种通过向 DNN 模型引入随机性的防御方法——随机激活剪枝(SAP)相比,我们发现我们的防御性 dropout 实现了大得多的梯度方差,这是改进防御效果(低得多的攻击成功率)的关键。例如,在当前最强攻击即 C&W 攻击下对 MNIST 数据集,我们的防御性 dropout 可将攻击成功率从 100% 降至 13.89%。
引用
@article{arxiv.1809.05165,
title = {Defensive Dropout for Hardening Deep Neural Networks under Adversarial Attacks},
author = {Siyue Wang and Xiao Wang and Pu Zhao and Wujie Wen and David Kaeli and Peter Chin and Xue Lin},
journal= {arXiv preprint arXiv:1809.05165},
year = {2018}
}
备注
Accepted as conference paper on ICCAD 2018