中文

针对深度网络的简单黑盒对抗扰动

机器学习 2016-12-20 v1 密码学与安全 机器学习

摘要

深度神经网络是强大且流行的学习模型,在许多计算机视觉、语音和语言处理任务上取得了 SOTA 的模式识别性能。然而,这些网络也被证明容易受到精心设计的对抗扰动的影响,这些扰动会迫使输入被误分类。对抗样本使对手能够颠覆预期的系统行为,导致不良后果,并可能在这些系统部署于现实世界时构成安全风险。在这项工作中,我们专注于深度卷积神经网络,并证明即使没有任何目标网络的内部知识,对手也能轻易地构造对抗样本。我们的攻击将网络视为预言机(黑盒),并且仅假设在探测输入上可以观察到网络的输出。我们的第一次攻击基于将扰动添加到随机选择的单个像素或一小部分像素的简单想法。然后,我们通过使用贪婪局部搜索的思想仔细构造一小部分像素进行扰动,从而提高了这种攻击的有效性。我们提出的攻击也自然地扩展到更强的误分类概念。我们广泛的实验结果表明,即使是这些基本攻击也能揭示深度神经网络的漏洞。我们提出的方案的简单性和有效性意味着它们可以作为设计鲁棒网络的石蕊测试。

关键词

引用

@article{arxiv.1612.06299,
  title  = {Simple Black-Box Adversarial Perturbations for Deep Networks},
  author = {Nina Narodytska and Shiva Prasad Kasiviswanathan},
  journal= {arXiv preprint arXiv:1612.06299},
  year   = {2016}
}

备注

19 Pages