将通用对抗攻击推广至加性扰动之外
计算机视觉与模式识别
2020-11-02 v2 密码学与安全
机器学习
摘要
先前的研究表明,通用对抗攻击可通过单个人类不可见的扰动在大量输入图像上欺骗深度神经网络。然而,当前的通用对抗攻击方法基于加性扰动,当扰动直接加到输入图像上时引起误分类。在本文中,我们首次表明通用对抗攻击也可通过非加性扰动(例如空间变换)实现。更重要的是,为统一加性与非加性扰动,我们提出了一种新颖的统一且灵活的通用对抗攻击框架,称为 GUAP,其能够通过加性扰动、非加性扰动或两者组合发起攻击。我们在 CIFAR-10 和 ImageNet 数据集上利用包括 GoogleLeNet、VGG16/19、ResNet101/152 和 DenseNet121 在内的六种深度神经网络模型进行了大量实验。实证实验表明,GUAP 在 CIFAR-10 和 ImageNet 数据集上分别可获得高达 90.9% 和 99.24% 的攻击成功率,相比当前最先进的通用对抗攻击分别带来超过 15% 和 19% 的提升。用于复现本文实验的代码可在 https://github.com/TrustAI/GUAP 获取。
引用
@article{arxiv.2010.07788,
title = {Generalizing Universal Adversarial Attacks Beyond Additive Perturbations},
author = {Yanghao Zhang and Wenjie Ruan and Fu Wang and Xiaowei Huang},
journal= {arXiv preprint arXiv:2010.07788},
year = {2020}
}
备注
A short version of this work will appear in the ICDM 2020 conference proceedings