中文

一种针对基于 LSTM 的文本分类系统的后门攻击

密码学与安全 2019-06-05 v2

摘要

随着深度学习系统在诸多应用中的广泛使用,攻击者有着强烈的动机去探索深度神经网络的漏洞并加以操纵。针对深度神经网络的后门攻击已被报道为一种新型威胁。在该攻击中,攻击者将后门注入模型,随后通过包含后门触发器的输入引发模型的错误行为。已有研究主要关注基于 CNN 的图像分类中的后门攻击,很少关注 RNN 中的后门攻击。在本文中,我们通过数据投毒实现了一种基于 LSTM 的文本分类后门攻击。当后门被注入后,模型会将任何包含特定触发器句子的文本样本误分类为攻击者指定的目标类别。后门触发器的存在是隐蔽的,且注入的后门对模型性能影响很小。我们考虑黑盒设定下的后门攻击,其中攻击者在除少量训练数据外对模型结构或训练算法一无所知。我们通过在 IMDB 影评数据集上的情感分析验证了该攻击。实验结果表明,我们的攻击在 1% 投毒率下可达到约 95% 的成功率。

关键词

引用

@article{arxiv.1905.12457,
  title  = {A backdoor attack against LSTM-based text classification systems},
  author = {Jiazhu Dai and Chuanshuai Chen},
  journal= {arXiv preprint arXiv:1905.12457},
  year   = {2019}
}