BadNets: 识别机器学习模型供应链中的漏洞
密码学与安全
2019-03-13 v2 机器学习
摘要
基于深度学习的技术在各种识别和分类任务上均达到了最先进的性能。然而,这些网络的训练通常计算开销巨大,需要在多个 GPU 上进行数周的计算;因此,许多用户将训练过程外包给云端,或依赖预训练模型并针对特定任务进行微调。本文表明,外包训练引入了新的安全风险:攻击者可以创建一个恶意训练的网络(即植入后门的神经网络,或称 BadNet),该网络在用户的训练和验证样本上表现出最先进的性能,但在攻击者精心选择的特定输入上表现异常。我们首先通过创建一个植入后门的手写数字分类器,在一个玩具示例中探索 BadNets 的特性。接着,我们通过创建一个美国交通标志分类器,在更现实的场景中演示后门:当在停车标志上贴上特殊贴纸时,该分类器会将停车标志识别为限速标志;我们进一步表明,即使网络后来被重新训练用于另一任务,我们的美国交通标志检测器中的后门依然可以持续存在,并在后门触发器出现时导致平均 25% 的准确率下降。这些结果表明,神经网络中的后门既强大又隐蔽——因为神经网络的行为难以解释。这项工作为进一步研究验证和检查神经网络的技术提供了动力,正如我们开发用于验证和调试软件的工具一样。
引用
@article{arxiv.1708.06733,
title = {BadNets: Identifying Vulnerabilities in the Machine Learning Model Supply Chain},
author = {Tianyu Gu and Brendan Dolan-Gavitt and Siddharth Garg},
journal= {arXiv preprint arXiv:1708.06733},
year = {2019}
}