中文

关于字符级神经机器翻译的对抗样本

计算与语言 2018-06-26 v1 人工智能

摘要

在对抗样本上进行评估已成为衡量深度学习模型鲁棒性的标准流程。由于在离散文本输入上构造白盒对抗样本的难度,大多数对 NLP 模型鲁棒性的分析都是通过黑盒对抗样本完成的。我们研究字符级神经机器翻译(NMT)的对抗样本,并将黑盒对抗者与一种新颖的白盒对抗者进行对比,后者采用可微分的字符串编辑操作来对对抗性改动进行排序。我们提出两种新型攻击,旨在移除或更改翻译中的一个词,而非简单地破坏 NMT。我们证明在不同攻击场景下,白盒对抗样本显著强于其黑盒对应样本,显示出比先前所知更严重的漏洞。此外,在执行对抗训练(仅比常规训练多花 3 倍时间)后,我们可以显著提升模型的鲁棒性。

关键词

引用

@article{arxiv.1806.09030,
  title  = {On Adversarial Examples for Character-Level Neural Machine Translation},
  author = {Javid Ebrahimi and Daniel Lowd and Dejing Dou},
  journal= {arXiv preprint arXiv:1806.09030},
  year   = {2018}
}