对抗环境下深度学习的局限性
密码学与安全
2015-11-25 v1 机器学习
神经与进化计算
机器学习
摘要
深度学习利用大型数据集和计算高效的训练算法,在各种机器学习任务中优于其他方法。然而,深度神经网络训练阶段的不完善使其易受对抗样本攻击:即对手精心构造以使深度神经网络误分类的输入。本文中,我们形式化针对深度神经网络(DNNs)的对手空间,并基于对DNN输入输出映射的精确理解,提出一类构造对抗样本的新算法。在计算机视觉应用中,我们表明我们的算法能可靠地生成被人类正确分类但被DNN以97%对抗成功率误分类至特定目标的样本,同时每样本平均仅修改4.02%的输入特征。随后,我们通过定义硬度度量评估不同样本类对对抗扰动的脆弱性。最后,我们描述初步工作,通过定义良性输入与目标分类间距离的预测度量,勾勒对抗样本的防御方法。
引用
@article{arxiv.1511.07528,
title = {The Limitations of Deep Learning in Adversarial Settings},
author = {Nicolas Papernot and Patrick McDaniel and Somesh Jha and Matt Fredrikson and Z. Berkay Celik and Ananthram Swami},
journal= {arXiv preprint arXiv:1511.07528},
year = {2015}
}
备注
Accepted to the 1st IEEE European Symposium on Security & Privacy, IEEE 2016. Saarbrucken, Germany