中文

基于平行数据投毒对黑盒神经机器翻译的定向攻击

计算与语言 2021-02-16 v2 密码学与安全

摘要

随着现代神经机器翻译(NMT)系统的广泛部署,其安全漏洞亟需仔细审视。最近研究发现,NMT系统易受定向攻击,攻击会使其产生特定的、非请求的甚至有害的翻译。这些攻击通常在白盒设定下被利用,即为已知目标系统发现导致定向翻译的对抗性输入。然而,当目标系统为黑盒且攻击方未知(例如受保护的商用系统)时,该方法不太可行。本文表明,基于对目标系统少量平行训练数据投毒,对黑盒NMT系统的定向攻击是可行的。我们展示了该攻击可通过针对性篡改爬取的网页文档(用于构成系统训练数据)在实际中实施。随后,我们在两种常见NMT训练场景下分析了定向投毒的有效性:从头训练和预训练&微调范式。我们的结果令人警觉:即使在用海量平行数据(数千万级)训练的最先进系统上,在惊人低廉的投毒比例(如0.006%)下攻击仍成功(成功率超50%)。最后,我们讨论了抵御此类攻击的潜在防御手段。

关键词

引用

@article{arxiv.2011.00675,
  title  = {A Targeted Attack on Black-Box Neural Machine Translation with Parallel Data Poisoning},
  author = {Chang Xu and Jun Wang and Yuqing Tang and Francisco Guzman and Benjamin I. P. Rubinstein and Trevor Cohn},
  journal= {arXiv preprint arXiv:2011.00675},
  year   = {2021}
}

备注

In Proceedings of the 2021 World Wide Web Conference (WWW 2021)