中文

神经网络清洗:从深度神经网络中移除黑盒后门水印

密码学与安全 2020-04-27 v1 机器学习 机器学习

摘要

创建最先进的深度学习系统需要大量数据、专业知识和硬件,然而关于为神经网络嵌入版权保护的研究一直有限。实现此类保护的主要方法之一是利用神经网络对后门攻击的易感性,但这些策略的鲁棒性主要针对剪枝、微调和模型反演攻击进行了评估。在本文中,我们提出一种神经网络“清洗”算法,即使 adversary 事先不知道水印的结构,也能从神经网络中移除黑盒后门水印。我们能够有效移除近期防御或版权保护机制所用的水印,同时在 MNIST 和 CIFAR-10 上分别达到 above 97% 和 80% 的测试准确率。对于本文涉及的所有后门水印方法,我们发现水印的鲁棒性明显弱于原始声称。我们还证明了我们的算法在更复杂任务以及更现实场景中的可行性,其中 adversary 能够使用小于原始训练集规模 1% 的数据进行高效清洗攻击,表明现有后门水印不足以达成其声称效果。

关键词

引用

@article{arxiv.2004.11368,
  title  = {Neural Network Laundering: Removing Black-Box Backdoor Watermarks from Deep Neural Networks},
  author = {William Aiken and Hyoungshick Kim and Simon Woo},
  journal= {arXiv preprint arXiv:2004.11368},
  year   = {2020}
}

备注

15 pages, 12 figures, 8 tables, formatted for ASIACCS 2020