中文

DLA:用于对抗样本检测的密集层分析

密码学与安全 2020-12-14 v1 机器学习

摘要

近年来,深度神经网络(DNN)取得了显著成果,甚至在广泛领域中展现出超越人类的能力。这使得人们信任 DNN 的分类及相应操作,即便在自动驾驶等安全敏感环境中。尽管成就惊人,DNN 已知易受对抗样本的攻击。此类输入含有微小扰动以故意欺骗被攻击模型。本文提出一种新颖的端到端框架,在分类过程中检测此类攻击而不影响目标模型性能。受近期神经元覆盖引导测试研究的启发,我们表明 DNN 的密集层携带安全敏感信息。我们利用一个辅助 DNN 分析分类运行时密集层的激活模式,从而实现高效且实时的对抗样本检测。我们的原型实现成功检测了图像、自然语言与音频处理中的对抗样本。由此,我们覆盖了多种目标 DNN,包括长短期记忆(LSTM)架构。此外,为有效防御当前最优(state-of-the-art)攻击,我们的方法在不同对抗样本集之间具有泛化能力。因此,我们的方法极有可能使我们检测出未来尚未知的攻击。最后,在白盒自适应攻击下,我们表明我们的方法不易被绕过。

关键词

引用

@article{arxiv.1911.01921,
  title  = {DLA: Dense-Layer-Analysis for Adversarial Example Detection},
  author = {Philip Sperl and Ching-Yu Kao and Peng Chen and Konstantin Böttinger},
  journal= {arXiv preprint arXiv:1911.01921},
  year   = {2020}
}