被投毒的分类器不仅存在后门,更已根本性地被破坏
机器学习
2021-10-06 v2 密码学与安全
摘要
在一种被广泛研究的针对分类模型的后门投毒攻击中,攻击者在训练数据的子集上添加一个小触发模式,使得测试时该触发模式的出现导致分类器总是预测某个目标类别。人们常隐含地假设被投毒的分类器仅对拥有该触发模式的对手脆弱。本文中,我们实证表明这种对后门分类器的看法是错误的。我们描述了一种针对被投毒分类器的新威胁模型,其中无原始触发模式知识的一方希望控制被投毒的分类器。在此威胁模型下,我们提出了一种测试时、人在回路的攻击方法,可在无初始后门与训练数据访问权限的情况下生成多个有效的替代触发模式。我们通过先为分类器的平滑版本(由称为去噪平滑 Denoised Smoothing 的过程创建)生成对抗样本,再经人工交互提取平滑对抗图像的颜色或裁剪部分来构造这些替代触发模式。我们在高分辨率数据集 ImageNet 和 TrojAI 上通过大量实验证明了我们攻击的有效性。我们还将我们的方法与先前关于触发模式分布建模的工作进行比较,发现我们的方法在生成有效触发模式上更具可扩展性与效率。最后,我们包含了一项用户研究,表明我们的方法使用户能轻易确定现有被投毒分类器中此类后门的存在。因此,我们认为被投毒的分类器中不存在所谓秘密后门:对分类器投毒不仅会招致拥有触发模式一方的攻击,也会招致任何能访问该分类器者的攻击。
引用
@article{arxiv.2010.09080,
title = {Poisoned classifiers are not only backdoored, they are fundamentally broken},
author = {Mingjie Sun and Siddhant Agarwal and J. Zico Kolter},
journal= {arXiv preprint arXiv:2010.09080},
year = {2021}
}