生成定向通用对抗扰动的简单迭代方法
计算机视觉与模式识别
2020-10-23 v2 密码学与安全
机器学习
摘要
深度神经网络(DNN)易受对抗攻击。特别是,被称为通用对抗扰动(UAP)的单一扰动可以挫败DNN执行的大多数分类任务。因此,需要不同的UAP生成方法以充分评估DNN的脆弱性。一种现实的评估是针对考虑定向攻击的情况;其中生成的UAP使DNN将输入分类到特定类别。然而,用于定向攻击的UAP的发展在很大程度上落后于用于非定向攻击的UAP。因此,我们提出一种简单迭代方法来生成用于定向攻击的UAP。我们的方法结合了用于生成非定向UAP的简单迭代方法和用于生成输入的定向对抗扰动的快速梯度符号方法。我们将所提方法应用于最先进的图像分类DNN模型,并证明了用于定向攻击的几乎不可察觉的UAP的存在;此外,我们证明了此类UAP易于生成。
引用
@article{arxiv.1911.06502,
title = {Simple iterative method for generating targeted universal adversarial perturbations},
author = {Hokuto Hirano and Kazuhiro Takemoto},
journal= {arXiv preprint arXiv:1911.06502},
year = {2020}
}
备注
4 pages, 3 figures, 1 table