中文

BadPre:面向预训练 NLP 基础模型的任务无关后门攻击

计算与语言 2021-10-07 v1 人工智能

摘要

预训练自然语言处理(NLP)模型可轻松适配于多种下游语言任务,这极大加速了语言模型的发展。然而,NLP 模型已被证明易受后门攻击,即输入文本中预定义的触发词导致模型误预测。以往的 NLP 后门攻击主要关注某些特定任务,这使得那些攻击的通用性较差,难以应用于其他类型的 NLP 模型与任务。本工作中,我们提出 \Name,首个针对预训练 NLP 模型的任务无关后门攻击。我们攻击的关键特征是:攻击者在向预训练模型植入后门时无需关于下游任务的先验信息。当该恶意模型被发布后,任何从其迁移得到的下游模型都将继承此后门,即便经过广泛的迁移学习过程也是如此。我们进一步设计了一种简单而有效的策略以绕过一种最先进的防御。实验结果表明,我们的方法能以有效且隐蔽的方式危害广泛的下游 NLP 任务。

关键词

引用

@article{arxiv.2110.02467,
  title  = {BadPre: Task-agnostic Backdoor Attacks to Pre-trained NLP Foundation Models},
  author = {Kangjie Chen and Yuxian Meng and Xiaofei Sun and Shangwei Guo and Tianwei Zhang and Jiwei Li and Chun Fan},
  journal= {arXiv preprint arXiv:2110.02467},
  year   = {2021}
}