多语言NMT中作为一门语言的翻译体
计算与语言
2020-07-13 v2
摘要
机器翻译有一种产生“翻译体”伪影的不受欢迎倾向,这可能导致更高的BLEU分数,却被人工评测者更不喜欢。受此启发,我们在多语言模型中将翻译体文本与原文(即自然文本)建模为不同的语言,并提出问题:我们能否在原文源文本与原文目标文本之间进行零样本翻译?由于没有同时包含原文源文本和原文目标文本的数据,我们训练句子级分类器以区分翻译体与原文目标文本,并用该分类器为NMT模型的训练数据打标签。利用该技术,我们在测试时使模型偏向生成更自然的输出,从而在人工评测的准确率和流畅度上均获得提升。此外,我们证明可以偏置模型生成翻译体并操纵BLEU分数,使其在提高的同时降低人工评测质量。我们使用度量输出中翻译体程度的指标分析这些模型,并针对基于启发式训练数据标注的反复无常性给出分析。
引用
@article{arxiv.1911.03823,
title = {Translationese as a Language in "Multilingual" NMT},
author = {Parker Riley and Isaac Caswell and Markus Freitag and David Grangier},
journal= {arXiv preprint arXiv:1911.03823},
year = {2020}
}