中文

以人为中心的语言模型中的隐藏后门

计算与语言 2021-09-29 v3 密码学与安全

摘要

自然语言处理(NLP)系统已被证明易受后门攻击,即隐藏特征(后门)被训练进语言模型中,且仅可由特定输入(称为触发器)激活,以诱使模型产生意外行为。在本文中,我们为文本后门攻击创建隐蔽且自然的触发器,即“隐藏后门”,其中触发器可同时欺骗现代语言模型和人工审查。我们通过两种最先进的触发器嵌入方法部署隐藏后门。第一种方法通过同形字替换,利用外观相似字符替换的视觉欺骗将触发器嵌入深度神经网络。第二种方法利用语言模型生成的文本与真实自然文本之间的细微差异,生成语法正确且流畅度高的触发句。我们证明了所提出的隐藏后门在三个下游安全关键 NLP 任务中均有效,这些任务代表了现代以人为中心的 NLP 系统,包括毒性评论检测、神经机器翻译(NMT)和问答(QA)。我们的两种隐藏后门攻击在毒性评论检测中以仅 3% 的注入率可实现至少 97% 的攻击成功率(ASR),在 NMT 中以低于 0.5% 的注入数据实现 95.1% 的 ASR,最后在 QA 中仅用 27 个投毒数据样本(此前模型以 92,024 个样本训练,占比 0.029%)更新即实现 91.12% 的 ASR。我们能够在保持常规用户功能的同时,展示攻击者极高的攻击成功率,且触发器不为人工管理员所察觉。

关键词

引用

@article{arxiv.2105.00164,
  title  = {Hidden Backdoors in Human-Centric Language Models},
  author = {Shaofeng Li and Hui Liu and Tian Dong and Benjamin Zi Hao Zhao and Minhui Xue and Haojin Zhu and Jialiang Lu},
  journal= {arXiv preprint arXiv:2105.00164},
  year   = {2021}
}