中文

关于检测对抗性扰动

机器学习 2017-02-22 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

近年来,机器学习尤其是深度学习在感知任务上取得了巨大进展。然而,它仍然容易受到对抗性扰动的攻击,这些扰动是专门设计用来欺骗系统,同时对人类而言几乎不可察觉。在本文中,我们提出用一个小型的“检测器”子网络来增强深度神经网络,该子网络在区分真实数据和包含对抗性扰动的数据的二分类任务上进行训练。我们的方法与以往解决对抗性扰动的工作正交,后者主要集中在使分类网络本身更加鲁棒。我们在实验中表明,尽管对抗性扰动对人类几乎不可察觉,但它们可以被出人意料地有效地检测出来。此外,虽然检测器仅被训练用于检测特定的对抗者,但它们能泛化到相似且较弱的对抗者。另外,我们提出了一种同时欺骗分类器和检测器的对抗性攻击,以及一种针对该攻击的检测器新型训练过程。

关键词

引用

@article{arxiv.1702.04267,
  title  = {On Detecting Adversarial Perturbations},
  author = {Jan Hendrik Metzen and Tim Genewein and Volker Fischer and Bastian Bischoff},
  journal= {arXiv preprint arXiv:1702.04267},
  year   = {2017}
}

备注

Final version for ICLR2017 (see https://openreview.net/forum?id=SJzCSf9xg&noteId=SJzCSf9xg)