使用行间注释作为低资源多语言机器翻译的枢轴
计算与语言
2020-03-04 v3
摘要
我们展示了一种利用普遍存在的语言资源——行间注释文本(IGT)进行低资源语言神经机器翻译(NMT)的新方法。IGT 将非英语句子表示为英语词根和语素标签的序列。因此,它可以用作 NMT 的枢轴或中间语言。我们的贡献有四点。首先,我们汇集了 ODIN 中 1,497 种语言的 IGT(54,545 条注释)以及 Arapaho 中的 70,918 条注释,并训练了从 IGT 到英语的注释到目标语 NMT 系统,BLEU 得分为 25.94。我们引入了多语言 NMT 模型,用注释源语言标签标记所有注释文本,并训练了一个跨 1,497 种语言共享注意力的通用系统。其次,我们将 IGT 注释到目标语翻译用作仅基于 ODIN 中 865 行训练的英土 MT 系统的关键步骤。第三,我们提出了五种在 BLEU 不再充分时评估极低资源翻译的指标,并使用 BLEU 以及名词、动词、一致关系、时态和虚假重复的匹配准确率来评估土耳其语低资源系统,显示出大幅改进。
引用
@article{arxiv.1911.02709,
title = {Using Interlinear Glosses as Pivot in Low-Resource Multilingual Machine Translation},
author = {Zhong Zhou and Lori Levin and David R. Mortensen and Alex Waibel},
journal= {arXiv preprint arXiv:1911.02709},
year = {2020}
}