中文

关于序列到序列模型的对抗扰动评估

计算与语言 2019-03-20 v2

摘要

对抗样本——对模型输入的扰动,可引发输出的大幅变化——已被证明是评估序列到序列(seq2seq)模型鲁棒性的有效方式。然而,仅当这些扰动未显著改变输入、以至于合理导致期望输出变化时,它们才指示模型的弱点。这一事实在日益增多的相关文献评估中基本被忽视。以机器翻译(MT)上的无目标攻击为例,我们提出一种针对 seq2seq 模型对抗攻击的新评估框架,该框架考虑了扰动前后输入的语义等价性。利用此框架,我们证明已有方法总体上可能不保持语义,打破了前述“源端扰动不应导致期望输出变化”的假设。我们进一步用该框架表明,对攻击施加额外约束可得到更保持语义但仍大幅改变输出序列的对抗扰动。最后,我们展示使用保持语义的攻击进行无目标对抗训练有益于模型的对抗鲁棒性,且不损害测试性能。实现我们评估框架的工具包发布于 https://github.com/pmichel31415/teapot-nlp。

关键词

引用

@article{arxiv.1903.06620,
  title  = {On Evaluation of Adversarial Perturbations for Sequence-to-Sequence Models},
  author = {Paul Michel and Xian Li and Graham Neubig and Juan Miguel Pino},
  journal= {arXiv preprint arXiv:1903.06620},
  year   = {2019}
}

备注

NAACL-HLT 2019 long paper