中文

知己之恶:基于分布外对抗样本的规避攻击分析

机器学习 2019-05-07 v1 密码学与安全 计算机视觉与模式识别 机器学习

摘要

近期大量工作研究了深度学习系统使用对抗样本的规避攻击现象,即对测试输入添加范数有界扰动会导致错误的输出分类。先前工作在研究这一现象时局限于封闭世界系统,其中训练与测试输入遵循预先指定的分布。然而,自动驾驶与内容分类等深度学习应用的真实部署很可能在开放世界环境中运行。本文中,我们展示了开放世界规避攻击的成功,其中对抗样本由分布外输入生成(OOD对抗样本)。在我们的研究中,我们使用了在3个复杂度各异的图像数据集上训练的11个SOTA神经网络模型。我们首先证明,SOTA的分布外数据检测器对OOD对抗样本并不鲁棒。接着我们考虑了5种已知的对抗样本防御方法,包括SOTA的鲁棒训练方法,并表明相较于由分布内数据生成的对抗样本,OOD对抗样本针对这些防御可实现高达4×\times更高的目标成功率。我们还定量考察了开放世界规避攻击如何影响真实系统。最后,我们提出了迈向鲁棒开放世界机器学习系统的初步步骤。

关键词

引用

@article{arxiv.1905.01726,
  title  = {Better the Devil you Know: An Analysis of Evasion Attacks using Out-of-Distribution Adversarial Examples},
  author = {Vikash Sehwag and Arjun Nitin Bhagoji and Liwei Song and Chawin Sitawarin and Daniel Cullina and Mung Chiang and Prateek Mittal},
  journal= {arXiv preprint arXiv:1905.01726},
  year   = {2019}
}

备注

18 pages, 5 figures, 9 tables