中文

精细剪枝:防御深度神经网络上的后门攻击

密码学与安全 2018-06-01 v1 机器学习

摘要

深度神经网络(DNNs)在广泛的分类任务上提供了优异的性能,但其训练需要高昂的计算资源,且经常外包给第三方。近期工作表明,外包训练引入了这样一种风险:恶意训练者会返回一个后门 DNN,该网络在大多数输入上表现正常,但当仅攻击者知晓的触发器出现时,会导致针对性误分类或降低网络的准确率。在本文中,我们提供了针对 DNN 上后门攻击的第一个有效防御。我们实现了先前工作中的三种后门攻击,并用它们来研究两种有前景的防御方法:剪枝和微调。我们表明,单独使用二者都不足以防御复杂的攻击者。然后我们评估了精细剪枝(剪枝与微调的结合),并表明它成功地削弱甚至消除了后门,即在某些情况下将攻击成功率降至 0%,而干净(无触发器)输入的准确率仅下降 0.4%。我们的工作为深度神经网络中后门攻击的防御提供了第一步。

关键词

引用

@article{arxiv.1805.12185,
  title  = {Fine-Pruning: Defending Against Backdooring Attacks on Deep Neural Networks},
  author = {Kang Liu and Brendan Dolan-Gavitt and Siddharth Garg},
  journal= {arXiv preprint arXiv:1805.12185},
  year   = {2018}
}