重新思考神经机器翻译的定向对抗攻击
计算与语言
2024-07-09 v1
摘要
定向对抗攻击被广泛用于评估神经机器翻译系统的鲁棒性。不幸的是,本文首先识别出现有NMT定向对抗攻击设置中的一个关键问题,即它们的攻击结果被严重高估。为此,本文提出了一种新的NMT定向对抗攻击设置,该设置能够产生可靠的攻击结果。在新设置下,本文随后提出了一种定向词梯度对抗攻击(TWGA)方法来生成对抗样本。实验结果表明,我们提出的设置为NMT系统上的定向对抗攻击提供了可信的攻击结果,并且所提出的TWGA方法能够有效攻击此类受害NMT系统。在大规模数据集上的深入分析进一步揭示了一些有价值的发现。我们的代码和数据可在https://github.com/wujunjie1998/TWGA获取。
引用
@article{arxiv.2407.05319,
title = {Rethinking Targeted Adversarial Attacks For Neural Machine Translation},
author = {Junjie Wu and Lemao Liu and Wei Bi and Dit-Yan Yeung},
journal= {arXiv preprint arXiv:2407.05319},
year = {2024}
}
备注
5 pages, 2 figures, accepted by ICASSP 2024