中文

对抗环境下深度学习的局限性

密码学与安全 2015-11-25 v1 机器学习 神经与进化计算 机器学习

摘要

深度学习利用大型数据集和计算高效的训练算法,在各种机器学习任务中优于其他方法。然而,深度神经网络训练阶段的不完善使其易受对抗样本攻击:即对手精心构造以使深度神经网络误分类的输入。本文中,我们形式化针对深度神经网络(DNNs)的对手空间,并基于对DNN输入输出映射的精确理解,提出一类构造对抗样本的新算法。在计算机视觉应用中,我们表明我们的算法能可靠地生成被人类正确分类但被DNN以97%对抗成功率误分类至特定目标的样本,同时每样本平均仅修改4.02%的输入特征。随后,我们通过定义硬度度量评估不同样本类对对抗扰动的脆弱性。最后,我们描述初步工作,通过定义良性输入与目标分类间距离的预测度量,勾勒对抗样本的防御方法。

关键词

引用

@article{arxiv.1511.07528,
  title  = {The Limitations of Deep Learning in Adversarial Settings},
  author = {Nicolas Papernot and Patrick McDaniel and Somesh Jha and Matt Fredrikson and Z. Berkay Celik and Ananthram Swami},
  journal= {arXiv preprint arXiv:1511.07528},
  year   = {2015}
}

备注

Accepted to the 1st IEEE European Symposium on Security & Privacy, IEEE 2016. Saarbrucken, Germany