中文

Impart:一种不可感知且有效的标签特定后门攻击

密码学与安全 2024-03-21 v1 人工智能

摘要

后门攻击已被证明对现实中的安全关键场景构成严重威胁。尽管先前的工作可以实现很高的攻击成功率,但它们要么需要访问受害者模型(这在实践中可能显著降低其威胁),要么在隐蔽性上具有视觉可察觉性。此外,在不同的中毒样本可能具有不同目标标签(即all-to-all设置)的场景下,攻击成功率仍有提高的空间。在本研究中,我们提出了一种名为Impart的新型不可感知后门攻击框架,适用于攻击者无法访问受害者模型的场景。具体而言,为了增强all-to-all设置的攻击能力,我们首先提出了一种标签特定攻击。与先前试图找到不可感知模式并将其作为中毒图像添加到源图像中的工作不同,我们随后提出通过代理模型生成在图像特征上与目标标签对齐的扰动。这样,生成的中毒图像被附加了关于目标类的知识,从而显著增强了攻击能力。

关键词

引用

@article{arxiv.2403.13017,
  title  = {Impart: An Imperceptible and Effective Label-Specific Backdoor Attack},
  author = {Jingke Zhao and Zan Wang and Yongwei Wang and Lanjun Wang},
  journal= {arXiv preprint arXiv:2403.13017},
  year   = {2024}
}