中文

机器翻译模型在对抗攻击面前表现稳健

计算与语言 2023-09-14 v1 密码学与安全 机器学习

摘要

对抗攻击通过对输入引入微小扰动来暴露深度学习模型的脆弱性,这些扰动会导致输出发生显著改变。我们的研究聚焦于此类对抗攻击对序列到序列(seq2seq)模型(特别是机器翻译模型)的影响。我们引入了结合基本文本扰动启发式方法和更先进策略(如基于梯度的攻击,其利用内在不可微翻译度量可微近似)的算法。通过我们的研究,我们提供证据表明机器翻译模型对已知表现最佳的对抗攻击表现出稳健性,因为输出中的扰动程度与输入中的扰动程度成正比。然而,在表现较弱的模型中,我们的攻击优于其他替代方法,提供了最佳的相对性能。另一个强有力的候选方案是基于单个字符混合的攻击。

关键词

引用

@article{arxiv.2309.06527,
  title  = {Machine Translation Models Stand Strong in the Face of Adversarial Attacks},
  author = {Pavel Burnyshev and Elizaveta Kostenok and Alexey Zaytsev},
  journal= {arXiv preprint arXiv:2309.06527},
  year   = {2023}
}