Regula Sub-rosa:深度神经网络上的潜在后门攻击
机器学习
2019-05-28 v1 密码学与安全
摘要
近期工作提出了深度神经网络(DNNs)后门攻击的概念,其中不当行为隐藏于“正常”模型内部,仅由非常特定的输入触发。然而在实践中,这些攻击难以实施,并高度受通过迁移学习共享模型的约束。攻击者在模型部署前必须攻陷学生模型的时间窗口很小。在本文中,我们描述了一种显著更强大的后门攻击变体——潜在后门(latent backdoors),其中隐藏规则可嵌入单个“教师”模型中,并通过迁移学习过程被所有“学生”模型自动继承。我们展示了潜在后门在多种应用情境中相当有效,并通过针对交通标志识别、实验室志愿者的虹膜识别以及公众人物(政客)人脸识别的真实世界攻击验证其实用性。最后,我们评估了 4 种潜在防御,发现仅有一种能有效破坏潜在后门,但可能以分类精度作为权衡代价。
引用
@article{arxiv.1905.10447,
title = {Regula Sub-rosa: Latent Backdoor Attacks on Deep Neural Networks},
author = {Yuanshun Yao and Huiying Li and Haitao Zheng and Ben Y. Zhao},
journal= {arXiv preprint arXiv:1905.10447},
year = {2019}
}