中文

将词语塞入系统之口:利用单语数据投毒对神经机器翻译的定向攻击

计算与语言 2021-07-13 v1 密码学与安全

摘要

神经机器翻译系统已知易受对抗性测试输入的攻击,然而正如本文所示,这些系统同样易受训练攻击。具体而言,我们提出了一种投毒攻击,其中恶意对手将一小段被投毒的单语文本插入到使用反向翻译训练的系统的训练集中。该样本旨在诱导特定的、定向的翻译行为,例如兜售错误信息。我们提出了两种构造投毒样本的方法,并表明仅需极少量实例(仅占训练集的 0.02%)就足以实施成功的攻击。我们概述了一种针对此类攻击的防御方法,该方法部分缓解了问题。然而,我们强调这是现代 NMT 中的一个盲点,亟需立即关注。

关键词

引用

@article{arxiv.2107.05243,
  title  = {Putting words into the system's mouth: A targeted attack on neural machine translation using monolingual data poisoning},
  author = {Jun Wang and Chang Xu and Francisco Guzman and Ahmed El-Kishky and Yuqing Tang and Benjamin I. P. Rubinstein and Trevor Cohn},
  journal= {arXiv preprint arXiv:2107.05243},
  year   = {2021}
}

备注

Findings of ACL, to appear