中文

面向神经机器翻译系统的情感感知对抗攻击

计算与语言 2023-06-27 v2 人工智能

摘要

随着深度学习方法的出现,神经机器翻译(NMT)系统已变得愈发强大。然而,基于深度学习的系统易受对抗攻击的影响,即对输入做出难以察觉的改动便可导致系统输出发生不合意的变化。迄今为止,针对序列到序列系统(如NMT模型)的对抗攻击研究甚少。NMT领域的已有工作考察了旨在向输出序列中引入目标短语的攻击。本文从输出感知的视角探讨NMT系统的对抗攻击。因此,攻击的目的是在不改变输入序列感知的前提下改变输出序列的感知。例如,攻击者可能将翻译评论的情感扭曲为夸张的积极情感。在实践中,开展大量人工感知实验颇具挑战,故采用作用于NMT输出的代理深度学习分类器来度量感知变化。实验表明,通过对输入序列做微小且难以察觉的改动,可显著改变NMT系统输出序列的情感感知。

关键词

引用

@article{arxiv.2305.01437,
  title  = {Sentiment Perception Adversarial Attacks on Neural Machine Translation Systems},
  author = {Vyas Raina and Mark Gales},
  journal= {arXiv preprint arXiv:2305.01437},
  year   = {2023}
}