ZOO:基于零阶优化的黑盒攻击深度神经网络,无需训练替代模型
机器学习
2017-11-03 v2 密码学与安全
机器学习
摘要
深度神经网络(DNNs)是当今最突出的技术之一,它们在许多机器学习任务中达到了最先进的性能,包括但不限于图像分类、文本挖掘和语音处理。然而,最近关于DNN的研究表明,人们越来越关注其对对抗样本的鲁棒性,特别是对于安全关键任务,如自动驾驶中的交通标志识别。研究通过展示能够生成几乎不可察觉(对人类和机器而言)且导致错误分类的对抗图像的能力,揭示了训练良好的DNN的脆弱性。此外,研究人员已经表明,这些对抗图像具有高度可迁移性,只需训练并攻击一个基于目标模型构建的替代模型,这被称为对DNN的黑盒攻击。与训练替代模型的设置类似,本文中我们提出了一种有效的黑盒攻击,该攻击也仅能访问目标DNN的输入(图像)和输出(置信度分数)。然而,与利用替代模型的攻击可迁移性不同,我们提出了基于零阶优化(ZOO)的攻击,直接估计目标DNN的梯度以生成对抗样本。我们使用零阶随机坐标下降,结合降维、分层攻击和重要性采样技术,来高效攻击黑盒模型。通过利用零阶优化,可以实现对目标DNN的改进攻击,从而无需训练替代模型,并避免了攻击可迁移性的损失。在MNIST、CIFAR10和ImageNet上的实验结果表明,所提出的ZOO攻击与最先进的白盒攻击同样有效,并且显著优于通过替代模型进行的现有黑盒攻击。
引用
@article{arxiv.1708.03999,
title = {ZOO: Zeroth Order Optimization based Black-box Attacks to Deep Neural Networks without Training Substitute Models},
author = {Pin-Yu Chen and Huan Zhang and Yash Sharma and Jinfeng Yi and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:1708.03999},
year = {2017}
}
备注
Accepted by 10th ACM Workshop on Artificial Intelligence and Security (AISEC) with the 24th ACM Conference on Computer and Communications Security (CCS)