中文

一种针对神经机器翻译模型的对抗攻击的松弛优化方法

计算与语言 2023-06-16 v1

摘要

在本文中,我们提出了一种基于优化的针对神经机器翻译(NMT)模型的对抗攻击。首先,我们提出一个优化问题来生成与原始句子语义相似但破坏目标 NMT 模型所生成翻译的对抗样本。该优化问题是离散的,我们提出一种连续松弛来求解它。通过这种松弛,我们为对抗样本中的每个 token 找到一个概率分布,然后可以通过从这些分布中采样来生成多个对抗样本。实验结果表明,我们的攻击在保持原始句子与对抗句子之间语义相似性的同时,显著降低了多个 NMT 模型的翻译质量。此外,我们的攻击在成功率、相似性保持、对翻译质量的影响和 token 错误率方面优于基线方法。最后,我们通过从梯度可访问的参考模型的优化概率分布中采样,提出了我们攻击的黑盒扩展。

关键词

引用

@article{arxiv.2306.08492,
  title  = {A Relaxed Optimization Approach for Adversarial Attacks against Neural Machine Translation Models},
  author = {Sahar Sadrizadeh and Clément Barbier and Ljiljana Dolamic and Pascal Frossard},
  journal= {arXiv preprint arXiv:2306.08492},
  year   = {2023}
}