针对神经机器翻译的定向对抗攻击
计算与语言
2023-03-03 v1 密码学与安全
机器学习
摘要
神经机器翻译(NMT)系统被应用于各种场景中。然而,已有研究表明它们对其输入的极小扰动(即所谓的对抗攻击)十分脆弱。在本文中,我们提出一种针对 NMT 模型的新型定向对抗攻击。具体而言,我们的目标是在保持源域中原始句子与扰动后句子之间相似性的同时,将预定义的目标关键词插入对抗句子的翻译中。为此,我们提出一个包含对抗损失项和相似性项的优化问题。我们利用嵌入空间中的梯度投影来构造对抗句子。实验结果表明,就成功率和翻译质量下降而言,我们的攻击在性能上优于另一种针对 NMT 模型的定向对抗攻击 Seq2Sick。我们的攻击在超过 75% 的句子中将关键词成功插入翻译,同时保持了与原句子的相似性。
引用
@article{arxiv.2303.01068,
title = {Targeted Adversarial Attacks against Neural Machine Translation},
author = {Sahar Sadrizadeh and AmirHossein Dabiri Aghdam and Ljiljana Dolamic and Pascal Frossard},
journal= {arXiv preprint arXiv:2303.01068},
year = {2023}
}
备注
ICASSP 2023, Code available at: http://github.com/sssadrizadeh/NMT-targeted-attack