子词切分与单一桥接语言对零样本神经机器翻译的影响
计算与语言
2020-11-04 v1
摘要
零样本神经机器翻译是一个引人注目的目标,因为获取数据和为新翻译方向构建翻译系统的成本很高。然而,以往的论文报道了零样本翻译成败参半的结果。很难预测在哪些设定下它会有效,以及与全监督系统相比是什么限制了性能。在本文中,我们研究了一个在多语WMT数据上训练的EN{FR,CS,DE,FI}多语系统的零样本性能。我们发现零样本性能高度不稳定,在不同训练运行间BLEU值差异可超过6,难以可靠地追踪改进。我们观察到零样本翻译中存在偏向复制源语言的倾向,并研究了子词切分的选择如何影响该偏向。我们发现特定语言的子词切分在训练时导致更少的子词复制,并且相较于联合训练的切分带来更好的零样本性能。多语模型近期的一个趋势是不在所有语言对上训练平行数据,而是采用单一桥接语言,例如英语。我们发现这会对零样本翻译产生负面影响,并导致一种失败模式:模型忽略语言标签,反而在零样本方向上输出英语。我们表明,即便在非英语语言对中加入少量平行数据,也能有效降低这种对英语的偏向。
引用
@article{arxiv.2011.01703,
title = {Subword Segmentation and a Single Bridge Language Affect Zero-Shot Neural Machine Translation},
author = {Annette Rios and Mathias Müller and Rico Sennrich},
journal= {arXiv preprint arXiv:2011.01703},
year = {2020}
}
备注
Accepted at WMT 2020