神经机器翻译中的领域鲁棒性
计算与语言
2020-09-28 v2
摘要
翻译偏离训练领域的文本是机器翻译的一项关键挑战。领域鲁棒性——模型对未见测试领域的泛化能力——在统计机器翻译(SMT)与神经机器翻译(NMT)中均较低。本文中,我们研究了 SMT 与 NMT 模型在域外测试集上的表现。我们发现,在未知领域中,SMT 与 NMT 遭受极为不同的问题:SMT 系统大多达意但不流畅,而 NMT 系统大多流畅但不达意。对于 NMT,我们将此类幻觉(与源文无关但流畅的翻译)确定为领域鲁棒性低的关键原因。为缓解该问题,我们凭经验比较了那些被报道可改善达意性或域内鲁棒性的方法在提升领域鲁棒性上的有效性。在德文到英文 OPUS 数据及德文到罗曼什文(低资源设定)的实验中,我们发现若干方法改善了领域鲁棒性。尽管这些方法确实总体上带来了更高的 BLEU 分数,但相比 SMT 仅略微提升了翻译的达意性。
引用
@article{arxiv.1911.03109,
title = {Domain Robustness in Neural Machine Translation},
author = {Mathias Müller and Annette Rios and Rico Sennrich},
journal= {arXiv preprint arXiv:1911.03109},
year = {2020}
}
备注
V2: AMTA camera-ready