检测机器翻译中词义消歧偏差以进行模型无关对抗攻击
计算与语言
2020-11-04 v1
摘要
词义消歧是神经机器翻译(NMT)中众所周知的翻译错误来源。我们假定,某些不正确的消歧选择是由于模型对训练数据中发现的 dataset artifacts(具体而言是浅层词共现)的过度依赖,而非对源文本的更深理解所致。我们引入了一种基于统计数据特性预测消歧错误的方法,证明了其在多个领域和模型类型上的有效性。此外,我们开发了一种简单的对抗攻击策略,该策略对句子进行最小扰动以引发消歧错误,从而进一步探查翻译模型的鲁棒性。我们的发现表明,消歧鲁棒性在不同领域间差异显著,并且在同一数据上训练的不同模型对不同的攻击脆弱。
引用
@article{arxiv.2011.01846,
title = {Detecting Word Sense Disambiguation Biases in Machine Translation for Model-Agnostic Adversarial Attacks},
author = {Denis Emelin and Ivan Titov and Rico Sennrich},
journal= {arXiv preprint arXiv:2011.01846},
year = {2020}
}
备注
Accepted to EMNLP 2020