中文

基于分类器引导的神经机器翻译对抗攻击方法

计算与语言 2024-02-23 v2

摘要

神经机器翻译(NMT)模型已被证明易受对抗攻击,即精心构造的输入扰动可误导目标模型。本文提出 ACT,一种由分类器引导的面向 NMT 系统的新型对抗攻击框架。在我们的攻击中, adversary 旨在构造保义的对抗样本,使得 NMT 模型给出的目标语言译文所属类别不同于原译文。与以往攻击不同,我们的新方法通过更改整体语义对翻译产生更实质影响,进而得到一个由 oracle 分类器判定的不同类别。为评估 NMT 模型对我们攻击的鲁棒性,我们通过对现有黑盒基于词替换的攻击进行增强,将目标 NMT 模型的输出译文及一分类器的输出 logits 纳入攻击过程。大量实验(含与现有无目标攻击的对比)表明,我们的攻击在改变输出译文类别上明显更成功,且对翻译影响更大。这一新范式通过关注译文类别而非传统所研究的单纯翻译质量,可揭示 NMT 系统的漏洞。

关键词

引用

@article{arxiv.2308.15246,
  title  = {A Classification-Guided Approach for Adversarial Attacks against Neural Machine Translation},
  author = {Sahar Sadrizadeh and Ljiljana Dolamic and Pascal Frossard},
  journal= {arXiv preprint arXiv:2308.15246},
  year   = {2024}
}