通过变异测试检测深度神经网络的对抗样本
机器学习
2018-05-18 v2 机器学习
摘要
最近,研究表明深度神经网络容易受到对抗样本的攻击。对抗样本通常通过对抗扰动精心构造,即对原始样本进行微小修改,使得 DNN 模型对样本进行错误标记。鉴于训练完美的 DNN 几乎是不可能的,对抗样本被证明很容易生成。随着 DNN 越来越多地用于自动驾驶汽车等安全关键系统,开发防御此类攻击的技术至关重要。旨在增加对抗扰动难度的现有防御机制已被证明是无效的。在这项工作中,我们提出了一种替代方法。我们首先观察到,对抗样本比正常样本对扰动敏感得多。也就是说,如果我们分别对正常样本和对抗样本施加随机扰动,由于扰动导致的标签改变比率之间存在显著差异。基于这一观察,我们设计了一种名为 nMutant 的统计对抗检测算法(受软件工程社区中变异测试的启发)。我们的实验表明,nMutant 有效地检测了最近提出的攻击方法生成的大多数对抗样本。此外,我们在检测的同时提供了具有一定统计显著性的误差界限。
引用
@article{arxiv.1805.05010,
title = {Detecting Adversarial Samples for Deep Neural Networks through Mutation Testing},
author = {Jingyi Wang and Jun Sun and Peixin Zhang and Xinyu Wang},
journal= {arXiv preprint arXiv:1805.05010},
year = {2018}
}
备注
Sumitted to NIPS 2018