中文

深度表征的对抗性操纵

计算机视觉与模式识别 2016-03-07 v9 机器学习 神经与进化计算

摘要

我们表明,深度神经网络(DNN)中图像的表示可以被操纵以模仿其他自然图像的表示,仅对原始图像进行微小、难以察觉的扰动。先前生成对抗图像的方法专注于设计用于产生错误类别标签的图像扰动,而我们集中于DNN表示的内部层。以此方式,我们的新一类对抗图像在性质上不同于其他对抗图像。尽管该对抗样本在感知上类似于某一图像,其内部表示却显著类似于另一幅不同类别的图像,与输入几乎没有明显的相似性;它们看起来具有通用性,且与自然图像空间一致。这一现象引发了关于DNN表示以及自然图像本身属性的疑问。

关键词

引用

@article{arxiv.1511.05122,
  title  = {Adversarial Manipulation of Deep Representations},
  author = {Sara Sabour and Yanshuai Cao and Fartash Faghri and David J. Fleet},
  journal= {arXiv preprint arXiv:1511.05122},
  year   = {2016}
}

备注

Accepted as a conference paper at ICLR 2016