一种通过无标签毒化的训练集污染实现 CNN 后门攻击的新方法
密码学与安全
2019-03-01 v1 计算机视觉与模式识别
机器学习
摘要
针对 CNN 的后门攻击代表了对深度学习系统的新威胁,因其可能污染训练集以在测试时诱导错误行为。为避免训练者识别出污染样本的存在,训练集的污染必须尽可能隐蔽。先前工作聚焦于注入训练样本的扰动的隐蔽性,但它们均假设污染样本的标签也被毒化。这极大降低了攻击的隐蔽性,因为内容与标签不符的样本可通过目视检查训练集或运行预分类步骤来识别。本文提出一种无标签毒化的新后门攻击。由于该攻击仅通过污染目标类的样本起作用,它还具有额外优势:无需事先识别测试时受攻击样本的类。在 MNIST 数字识别任务和交通标志分类任务上获得的结果表明,无标签毒化的后门攻击确实可行,从而就对深度学习在安全关键应用中的使用敲响了新的警钟。
引用
@article{arxiv.1902.11237,
title = {A new Backdoor Attack in CNNs by training set corruption without label poisoning},
author = {Mauro Barni and Kassem Kallas and Benedetta Tondi},
journal= {arXiv preprint arXiv:1902.11237},
year = {2019}
}