中文

神射手后门:可任意指定目标类的后门攻击

密码学与安全 2022-10-18 v1 计算机视觉与模式识别

摘要

近年来,机器学习模型已被证明易受后门攻击。在此类攻击下, adversary 将隐蔽后门嵌入训练后的模型中,使得被攻陷的模型在干净输入上表现正常,但在带有触发器的恶意构造输入上会按照 adversary 的控制产生误分类。尽管现有这些攻击非常有效,但 adversary 的能力受限:给定一个输入,这些攻击只能使模型误分类至单一预定义或目标类。相比之下,本文利用一种具有更强攻击载荷的新型后门攻击,记为 Marksman(神射手),其中 adversary 可在推理时对任意输入任意选择模型将误分类至哪个目标类。为实现该目标,我们提出将触发器函数表示为类条件生成模型,并在约束优化框架中注入后门,其中触发器函数学习生成最优触发器模式以随意攻击任意目标类,同时将该生成式后门嵌入训练模型。给定学习到的触发器生成函数,在推理期间,adversary 可指定任意后门攻击目标类,并相应创建使模型分类至该目标类的合适触发器。我们通过实验证明,所提框架在 MNIST、CIFAR10、GTSRB 和 TinyImageNet 等多个基准数据集上实现了高攻击性能,同时保持干净数据性能。所提 Marksman 后门攻击还可轻松绕过现有专为单一目标类后门攻击设计的后门防御。我们的工作朝着理解实践中后门攻击的广泛风险又迈出了重要一步。

关键词

引用

@article{arxiv.2210.09194,
  title  = {Marksman Backdoor: Backdoor Attacks with Arbitrary Target Class},
  author = {Khoa D. Doan and Yingjie Lao and Ping Li},
  journal= {arXiv preprint arXiv:2210.09194},
  year   = {2022}
}

备注

Accepted to NeurIPS 2022