用于欺骗深度神经网络的单像素攻击
机器学习
2019-10-18 v7 计算机视觉与模式识别
机器学习
摘要
近期研究表明,通过向输入向量添加相对较小的扰动,可以轻易改变深度神经网络 (DNN) 的输出。在本文中,我们分析了一种极端受限场景下的攻击,即仅允许修改一个像素。为此,我们提出了一种基于差分进化 (DE) 生成单像素对抗扰动的新型方法。该方法需要较少的对抗信息(黑盒攻击),并且由于 DE 的固有特性,能够欺骗更多类型的网络。结果表明,通过仅修改一个像素,Kaggle CIFAR-10 测试数据集中 67.97% 的自然图像和 ImageNet (ILSVRC 2012) 测试图像中 16.04% 的图像可被扰动至至少一个目标类别,平均置信度分别为 74.03% 和 22.91%。我们还在原始 CIFAR-10 数据集上展示了同样的脆弱性。因此,所提出的攻击在极端受限场景下探索了对抗机器学习的不同视角,表明当前的 DNN 也易受此类低维攻击的影响。此外,我们还阐述了 DE(或广义上的进化计算)在对抗机器学习领域的一个重要应用:创建能够有效生成低成本对抗攻击的工具,以评估神经网络的鲁棒性。
引用
@article{arxiv.1710.08864,
title = {One pixel attack for fooling deep neural networks},
author = {Jiawei Su and Danilo Vasconcellos Vargas and Sakurai Kouichi},
journal= {arXiv preprint arXiv:1710.08864},
year = {2019}
}