中文

Humpty Dumpty:通过语料库投毒控制词义

计算与语言 2020-01-15 v1 密码学与安全 机器学习 机器学习

摘要

词嵌入,即GloVe和SGNS等低维向量表示,以词间向量距离对应语义邻近性的方式编码词的“含义”。这使得语义的迁移学习可用于多种自然语言处理任务。词嵌入通常在维基百科或Twitter等大型公开语料库上训练。我们证明,能够修改嵌入训练所用语料库的攻击者,可通过改变词在嵌入空间中的位置来控制新词与已有词的“含义”。我们推导了语料库特征上的显式表达式,作为词间距离的代理,并确立其值与该嵌入距离间的因果关系。随后我们展示如何将此关系用于两个对抗目标:(1)使一个词成为另一个词的顶级近邻,(2)将一个词从一个语义簇移至另一语义簇。对嵌入的攻击可影响多种下游任务,首次展示了数据投毒在迁移学习场景中的威力。我们利用该攻击操纵信息检索系统(如简历搜索)中的查询扩展,使特定姓名在命名实体识别模型中更显或隐,并导致新词被翻译为特定目标词而不论其语言。最后,我们展示攻击者如何生成语言上可信的语料库修改,从而欺骗那些试图利用语言模型从语料库过滤不合理句子的防御手段。

关键词

引用

@article{arxiv.2001.04935,
  title  = {Humpty Dumpty: Controlling Word Meanings via Corpus Poisoning},
  author = {Roei Schuster and Tal Schuster and Yoav Meri and Vitaly Shmatikov},
  journal= {arXiv preprint arXiv:2001.04935},
  year   = {2020}
}

备注

Accepted at IEEE S&P 2020