女巫酿造:基于梯度匹配的工业级数据投毒
计算机视觉与模式识别
2021-05-11 v2 机器学习
摘要
数据投毒攻击通过修改训练数据来恶意控制在此类数据上训练的模型。本工作中,我们关注目标投毒攻击,其导致未修改的测试图像被重新分类,从而破坏模型完整性。我们考虑一种尤其恶意的投毒攻击,它既是“从零开始”又是“干净标签”的,即我们分析一种对新的随机初始化模型均成功生效、且对人类几乎不可察觉、同时仅扰动一小部分训练数据的攻击。此前针对深度神经网络在此设定下的投毒攻击范围与成功率有限,仅能在简化设定下工作,或对大型数据集而言成本高得令人望而却步。新攻击的核心机制是匹配恶意样本的梯度方向。我们分析了其生效原因,补充了实际考量,并展示了其对现实从业者的威胁,发现它是首个在现代深度网络(从零开始在完整规模的投毒 ImageNet 数据集上训练)中引发目标误分类的投毒方法。最后我们展示了现有防御策略对此类攻击的局限性,得出结论:数据投毒是可信威胁,即便对大规模深度学习系统亦然。
引用
@article{arxiv.2009.02276,
title = {Witches' Brew: Industrial Scale Data Poisoning via Gradient Matching},
author = {Jonas Geiping and Liam Fowl and W. Ronny Huang and Wojciech Czaja and Gavin Taylor and Michael Moeller and Tom Goldstein},
journal= {arXiv preprint arXiv:2009.02276},
year = {2021}
}
备注
First two authors contributed equally. Last two authors contributed equally. 21 pages, 11 figures. Published at ICLR 2021