中文

EagleEye:针对对抗性输入的攻击无关防御(技术报告)

密码学与安全 2018-08-02 v1 机器学习

摘要

深度神经网络(DNN)天生易受对抗性输入的攻击:此类恶意构造的样本会触发 DNN 异常行为,从而对由 DNN 驱动的系统造成有害后果。缓解对抗性输入的根本挑战源于其自适应与多变的特性。现有方案试图提升 DNN 针对特定攻击的鲁棒性;然而,此类静态防御常可被自适应设计的输入或新型攻击变体所规避。在此,我们提出 EagleEye,一种用于 DNN 驱动系统的攻击无关对抗篡改分析引擎。我们的设计利用了众多攻击背后的最小性原理:为最大化攻击的隐蔽性, adversary 常寻求以最小可能的失真将真实输入转换为对抗样本。我们表明,这一做法在输入空间中赋予了对抗性输入独特的分布特性。通过以原则性方式利用此类特性,EagleEye 能有效判别对抗性输入,甚至揭示其正确的分类输出。通过使用一系列基准数据集与 DNN 模型进行广泛的实证评估,我们验证了 EagleEye 的有效性。我们进一步研究了 adversary 可能的对抗措施,这暗示其面临艰难困境:为规避 EagleEye 的检测,必须施加过度失真,从而显著降低攻击相对于其他检测机制的隐蔽性。

关键词

引用

@article{arxiv.1808.00123,
  title  = {EagleEye: Attack-Agnostic Defense against Adversarial Inputs (Technical Report)},
  author = {Yujie Ji and Xinyang Zhang and Ting Wang},
  journal= {arXiv preprint arXiv:1808.00123},
  year   = {2018}
}