中文

对抗样本与干净数据并非孪生

机器学习 2017-04-18 v1 神经与进化计算

摘要

对抗攻击给深度神经网络的巨大成功蒙上了阴影。尽管对抗图像与干净数据在视觉上几乎相同,却能以极高置信度欺骗深度神经网络做出错误预测。然而,本文中我们展示可以构建一个简单的二分类器,以超过 99% 的准确率将对抗样本与干净数据分离。我们还通过实验表明该二分类器对第二轮对抗攻击具有鲁棒性。换言之,难以伪装对抗样本以绕过该二分类器。此外,我们实证研究了萦绕所有当前防御方法(包括二分类器方法)的泛化局限,并假设这是对抗构造算法内在属性的结果。

关键词

引用

@article{arxiv.1704.04960,
  title  = {Adversarial and Clean Data Are Not Twins},
  author = {Zhitao Gong and Wenlu Wang and Wei-Shinn Ku},
  journal= {arXiv preprint arXiv:1704.04960},
  year   = {2017}
}