中文

Imperio:用于任意模型控制的语言引导后门攻击

密码学与安全 2024-03-18 v2 机器学习

摘要

自然语言处理(NLP)受到了前所未有的关注。虽然 NLP 模型的进步引发了对其后门漏洞的广泛研究,但这些进步引入新后门威胁的潜力仍未被探索。本文提出了 Imperio,它利用 NLP 模型的语言理解能力来丰富后门攻击。Imperio 提供了一种新的模型控制体验。通过控制图像分类器进行的演示表明,它使攻击者能够通过语言引导的指令操纵受害模型产生任意输出。这是通过使用语言模型为条件触发器生成器提供动力来实现的,并进行了优化设计,将其语言理解能力扩展到后门指令的解释和执行。我们在三个数据集、五种攻击和九种防御上的实验证实了 Imperio 的有效性。它能够从文本描述中生成上下文自适应的触发器,并控制受害模型产生期望的输出,即使在训练期间未遇到的场景中也是如此。该攻击在复杂数据集上达到了高成功率,同时不损害干净输入的准确性,并表现出对代表性防御的弹性。

关键词

引用

@article{arxiv.2401.01085,
  title  = {Imperio: Language-Guided Backdoor Attacks for Arbitrary Model Control},
  author = {Ka-Ho Chow and Wenqi Wei and Lei Yu},
  journal= {arXiv preprint arXiv:2401.01085},
  year   = {2024}
}