中文

MagNet:一种防御对抗样本的双管齐下方法

密码学与安全 2017-09-12 v2 机器学习

摘要

近年来,深度学习在困难的感知问题上展现出令人鼓舞的成果。然而,深度学习系统被发现易受人类几乎无法察觉的微小对抗扰动影响。此类精心构造的扰动会导致深度学习系统输出错误决策,可能带来灾难性后果。这些脆弱性阻碍了深度学习系统在安全或安保至关重要的场景中部署。现有保护深度学习系统的尝试要么针对特定攻击,要么已被证明效果不佳。本文提出 MagNet,一个防御神经网络分类器免受对抗样本攻击的框架。MagNet 不修改受保护的分类器,也不知晓对抗样本的生成过程。MagNet 包含一个或多个独立的检测器网络和一个重构器网络。与以往工作不同,MagNet 通过逼近正常样本的流形来学习区分正常样本与对抗样本。由于不依赖任何对抗样本生成过程,它具有很强的泛化能力。此外,MagNet 通过将对抗样本移向流形来重构它们,这有助于正确分类具有小扰动的对抗样本。我们讨论了防御白盒攻击的内在困难,并提出了一种防御灰盒攻击的机制。受密码学中使用随机性的启发,我们提出利用多样性来增强 MagNet。实验表明,MagNet 在黑盒和灰盒场景下能有效防御大多数最先进的攻击,同时将正常样本的假阳性率保持在极低水平。

关键词

引用

@article{arxiv.1705.09064,
  title  = {MagNet: a Two-Pronged Defense against Adversarial Examples},
  author = {Dongyu Meng and Hao Chen},
  journal= {arXiv preprint arXiv:1705.09064},
  year   = {2017}
}

备注

Accepted at the ACM Conference on Computer and Communications Security (CCS), 2017