中文

植入后门的语言模型:娱乐与获利

密码学与安全 2021-03-12 v2 计算与语言 机器学习

摘要

近年来出现了一种构建自然语言处理(NLP)系统的新范式:通用预训练语言模型(LM)与简单下游模型组合并为多种 NLP 任务微调。这种范式转变显著简化了系统开发周期。然而,由于许多 LM 由不受信任的第三方提供,其缺乏标准化或监管带来了深远的安全影响,而这些影响在很大程度上未被探索。为弥补此差距,本工作研究了恶意 LM 对 NLP 系统构成的安全威胁。具体而言,我们提出 TROJAN-LM,一类新的后门攻击,其中被恶意构造的 LM 触发宿主 NLP 系统以高度可预测的方式 malfunction。通过对一系列安全关键 NLP 任务(有毒评论检测、问答、文本补全)中三个最先进 LM(BERT、GPT-2、XLNet)的实证研究,以及在众包平台上的用户研究,我们证明 TROJAN-LM 具有以下属性:(i)灵活性—— adversary 能够灵活地将任意词的逻辑组合(如“and”、“or”、“xor”)定义为触发器,(ii)有效性——当存在触发器嵌入输入时,宿主系统以高概率按 adversary 期望的方式 misbehave,(iii)特异性——后门 LM 在干净输入上的功能与其良性对应物无法区分,以及(iv)流畅性——触发器嵌入输入表现为流畅的自然语言且与其上下文高度相关。我们为 TROJAN-LM 的实用性提供了分析依据,并进一步讨论了潜在的应对措施及其挑战,由此引出若干有前景的研究方向。

关键词

引用

@article{arxiv.2008.00312,
  title  = {Trojaning Language Models for Fun and Profit},
  author = {Xinyang Zhang and Zheng Zhang and Shouling Ji and Ting Wang},
  journal= {arXiv preprint arXiv:2008.00312},
  year   = {2021}
}

备注

Additional experiments and text editing; To appear in 2021 6th IEEE European Symposium on Security and Privacy