中文

BadNL:针对 NLP 模型且具有语义保持改进的後门攻击

密码学与安全 2021-10-06 v2 机器学习

摘要

深度神经网络(DNNs)在过去十年中发展迅速,并已部署于各种现实应用中。与此同时,DNN 模型已被证明易受安全和隐私攻击。其中,近年来备受关注的一种攻击是後门攻击。具体而言,攻击者在目标模型的训练集中下毒,以使任何添加了秘密触发器的输入被误分类至目标类。以往的後门攻击主要集中于计算机视觉(CV)应用,如图像分类。在本文中,我们对 NLP 模型上的後门攻击进行了系统性研究,并提出了 BadNL,一个包含新颖攻击方法的通用 NLP 後门攻击框架。具体而言,我们提出了三种构造触发器的方法,即 BadChar、BadWord 和 BadSentence,包含基础变体与语义保持变体。我们的攻击在几乎不影响原模型效用的前提下达到了近乎完美的攻击成功率。例如,使用 BadChar 时,我们的後门攻击在 SST-5 数据集上仅下毒 3% 的原始集合便取得了 98.9% 的攻击成功率,且使效用提升了 1.5%。此外,我们进行了用户研究以证明我们的触发器能从人类视角很好地保持语义。

关键词

引用

@article{arxiv.2006.01043,
  title  = {BadNL: Backdoor Attacks against NLP Models with Semantic-preserving Improvements},
  author = {Xiaoyi Chen and Ahmed Salem and Dingfan Chen and Michael Backes and Shiqing Ma and Qingni Shen and Zhonghai Wu and Yang Zhang},
  journal= {arXiv preprint arXiv:2006.01043},
  year   = {2021}
}

备注

To appear in Annual Computer Security Applications Conference (ACSAC) 2021