中文

基于模型变异测试的深层神经网络对抗样本检测

机器学习 2019-11-22 v2 软件工程 机器学习

摘要

深度神经网络(DNN)已被证明在广泛应用中有用。然而,它们也已知易受对抗样本的攻击。通过对正常样本施加某些精心构造的、人类难以察觉的扰动,即便高度准确的 DNN 也会做出错误决策。已有多种旨在阻碍此类对抗样本生成的防御机制被提出。然而,近期工作表明其中大多数无效。在本工作中,我们提出一种在运行时检测对抗样本的替代方法。我们的主要观察是:若对 DNN 施加随机变异,对抗样本比正常样本敏感得多。因此我们首先提出一种“敏感度”度量,并经验性地表明正常样本与对抗样本具有可区分的敏感度。我们随后整合统计假设检验与模型变异测试,通过度量输入样本的敏感度,在运行时判断其更可能为正常样本还是对抗样本。我们在 MNIST 与 CIFAR10 数据集上评估了我们的方法。结果表明,我们的方法能高效且准确地检测由最先进攻击方法生成的对抗样本。

关键词

引用

@article{arxiv.1812.05793,
  title  = {Adversarial Sample Detection for Deep Neural Network through Model Mutation Testing},
  author = {Jingyi Wang and Guoliang Dong and Jun Sun and Xinyu Wang and Peixin Zhang},
  journal= {arXiv preprint arXiv:1812.05793},
  year   = {2019}
}

备注

Accepted by ICSE 2019