警惕被投毒的词嵌入:探究 NLP 模型中嵌入层的脆弱性
计算与语言
2021-03-30 v1
摘要
近期研究揭示了自然语言处理(NLP)模型面临的一种安全威胁,称为后门攻击。受害模型在干净样本上可保持有竞争力的性能,而在插入特定触发词样本上表现异常。以往的后门攻击方法通常假设攻击者具有一定程度的数据知识,即用户将使用的数据集或类似任务的代理数据集,以实施数据投毒过程。然而,本文中发现,通过修改单一词嵌入向量,几乎不牺牲干净样本上的准确率,便可以以无数据方式攻击模型。在情感分析和句子对分类任务上的实验结果表明,我们的方法更高效且更隐蔽。我们希望本工作能提高对隐藏在 NLP 模型嵌入层中的这一关键安全风险的认识。我们的代码见 https://github.com/lancopku/Embedding-Poisoning。
引用
@article{arxiv.2103.15543,
title = {Be Careful about Poisoned Word Embeddings: Exploring the Vulnerability of the Embedding Layers in NLP Models},
author = {Wenkai Yang and Lei Li and Zhiyuan Zhang and Xuancheng Ren and Xu Sun and Bin He},
journal= {arXiv preprint arXiv:2103.15543},
year = {2021}
}
备注
NAACL-HLT 2021, Long Paper