中文

评估神经网络的鲁棒性

密码学与安全 2017-03-23 v2 计算机视觉与模式识别

摘要

神经网络在大多数机器学习任务中提供了最先进的结果。不幸的是,神经网络容易受到对抗样本的攻击:给定输入xx和任意目标分类tt,可以找到一个与xx相似但被分类为tt的新输入xx'。这使得神经网络难以应用于安全关键领域。防御性蒸馏是最近提出的一种方法,可以接受任意神经网络并提高其鲁棒性,将当前攻击找到对抗样本的成功率从95%95\%降低到0.5%0.5\%。在本文中,我们通过引入三种新的攻击算法,证明防御性蒸馏并未显著提高神经网络的鲁棒性,这些算法在蒸馏和未蒸馏的神经网络上均能以100%100\%的概率成功。我们的攻击针对文献中先前使用的三种距离度量进行了定制,与以往的对抗样本生成算法相比,我们的攻击通常更有效(且从不更差)。此外,我们提出在一个简单的可迁移性测试中使用高置信度对抗样本,我们证明该测试也可用于攻破防御性蒸馏。我们希望我们的攻击能作为未来防御尝试的基准,以创建能够抵抗对抗样本的神经网络。

关键词

引用

@article{arxiv.1608.04644,
  title  = {Towards Evaluating the Robustness of Neural Networks},
  author = {Nicholas Carlini and David Wagner},
  journal= {arXiv preprint arXiv:1608.04644},
  year   = {2017}
}