中文

针对防御性蒸馏深度神经网络的增强攻击

计算机视觉与模式识别 2017-11-17 v1 密码学与安全 机器学习

摘要

深度神经网络(DNNs)在机器学习诸多任务中取得了巨大成功,例如图像分类。遗憾的是,研究者已表明 DNNs 易受对抗样本攻击,即轻微扰动的图片可误导 DNNs 给出错误分类结果。此类攻击严重阻碍了 DNN 系统在安全或可靠性要求严格领域(如自动驾驶汽车、人脸识别、恶意软件检测)的部署。防御性蒸馏是一种旨在训练鲁棒 DNN 的机制,可显著降低对抗样本生成的有效性。然而,当前最先进的攻击能以 100% 概率在蒸馏网络上成功,但其为需知晓 DNN 内部信息的白盒攻击。而黑盒场景更为普遍。本文中,我们首先提出 epsilon-邻域攻击,可在白盒设定下以 100% 成功率欺骗防御性蒸馏网络,且能快速生成具良好视觉质量的对抗样本。基于此攻击,我们进一步提出针对防御性蒸馏 DNNs 的黑盒设定区域攻击。我们还执行了绕过攻击作为补充方法间接突破蒸馏防御。实验结果表明,我们的黑盒攻击在防御性蒸馏网络上具有可观的成功率。

关键词

引用

@article{arxiv.1711.05934,
  title  = {Enhanced Attacks on Defensively Distilled Deep Neural Networks},
  author = {Yujia Liu and Weiming Zhang and Shaohua Li and Nenghai Yu},
  journal= {arXiv preprint arXiv:1711.05934},
  year   = {2017}
}