中文

深入探究可迁移对抗样本与黑盒攻击

机器学习 2017-02-08 v3

摘要

深度神经网络一个引人注目的特性是对抗样本的存在,它们可以在不同架构间迁移。这些可迁移的对抗样本可能严重阻碍基于深度神经网络的应用。先前的工作大多使用小规模数据集研究可迁移性。本工作中,我们首次对大型模型和大规模数据集上的可迁移性进行了广泛研究,并且我们也首次研究了带有目标标签的目标对抗样本的迁移性。我们研究了非目标和目标对抗样本,并表明虽然非目标可迁移对抗样本易于找到,但使用现有方法生成的目标对抗样本几乎从不随其目标标签迁移。因此,我们提出了基于集成的生成可迁移对抗样本的新方法。使用这些方法,我们首次观察到很大比例的目标对抗样本能够随其目标标签迁移。我们还进行了一些几何研究以帮助理解可迁移对抗样本。最后,我们展示了使用基于集成方法生成的对抗样本能够成功攻击Clarifai.com,这是一个黑盒图像分类系统。

关键词

引用

@article{arxiv.1611.02770,
  title  = {Delving into Transferable Adversarial Examples and Black-box Attacks},
  author = {Yanpei Liu and Xinyun Chen and Chang Liu and Dawn Song},
  journal= {arXiv preprint arXiv:1611.02770},
  year   = {2017}
}