中文

警惕被投毒的词嵌入:探究 NLP 模型中嵌入层的脆弱性

计算与语言 2021-03-30 v1

摘要

近期研究揭示了自然语言处理(NLP)模型面临的一种安全威胁,称为后门攻击。受害模型在干净样本上可保持有竞争力的性能,而在插入特定触发词样本上表现异常。以往的后门攻击方法通常假设攻击者具有一定程度的数据知识,即用户将使用的数据集或类似任务的代理数据集,以实施数据投毒过程。然而,本文中发现,通过修改单一词嵌入向量,几乎不牺牲干净样本上的准确率,便可以以无数据方式攻击模型。在情感分析和句子对分类任务上的实验结果表明,我们的方法更高效且更隐蔽。我们希望本工作能提高对隐藏在 NLP 模型嵌入层中的这一关键安全风险的认识。我们的代码见 https://github.com/lancopku/Embedding-Poisoning。

关键词

引用

@article{arxiv.2103.15543,
  title  = {Be Careful about Poisoned Word Embeddings: Exploring the Vulnerability of the Embedding Layers in NLP Models},
  author = {Wenkai Yang and Lei Li and Zhiyuan Zhang and Xuancheng Ren and Xu Sun and Bin He},
  journal= {arXiv preprint arXiv:2103.15543},
  year   = {2021}
}

备注

NAACL-HLT 2021, Long Paper