中文

蒸馏作为抵御针对深度神经网络对抗扰动的防御方法

密码学与安全 2016-03-15 v2 机器学习 神经与进化计算 机器学习

摘要

深度学习算法已被证明在许多经典机器学习问题上表现极佳。然而,近期研究表明,深度学习与其他机器学习技术一样,易受对抗样本攻击:即精心构造输入以迫使深度神经网络(DNN)给出攻击者选定的输出。此类攻击会严重破坏由DNN支撑的系统安全性,有时后果灾难性。例如,自动驾驶车辆可能撞毁,非法内容可绕过内容过滤器,或生物特征认证系统被操纵以允许非法访问。本工作中,我们引入一种称为防御性蒸馏(defensive distillation)的防御机制,以降低对抗样本对DNN的有效性。我们分析研究了训练DNN时使用防御性蒸馏所带来的泛化性与鲁棒性特性。我们还实证研究了我们的防御机制在两种置于对抗环境中的DNN上的有效性。研究表明,防御性蒸馏可将所研究DNN上样本生成的有效性从95%降至低于0.5%。这种显著收益可解释为蒸馏使对抗样本生成中使用的梯度减小了10^30倍。我们还发现,蒸馏在我们测试的一个DNN上,将创建对抗样本所需修改的平均最小特征数量提高了约800%。

关键词

引用

@article{arxiv.1511.04508,
  title  = {Distillation as a Defense to Adversarial Perturbations against Deep Neural Networks},
  author = {Nicolas Papernot and Patrick McDaniel and Xi Wu and Somesh Jha and Ananthram Swami},
  journal= {arXiv preprint arXiv:1511.04508},
  year   = {2016}
}