适用于低资源语言的低资源机器翻译训练课程
计算与语言
2021-11-30 v2
摘要
我们对真正低资源语言的神经机器翻译(NMT)进行了实证研究,并提出了一种适用于平行训练数据与计算资源均匮乏情形的训练课程,这反映了世界上大多数语言以及研究这些语言的研究人员的现实。此前,采用回译(BT)与自编码(AE)任务的无监督NMT已被证明对低资源语言收效甚微。我们证明,利用可比数据与语码转换作为弱监督,并结合BT与AE目标,即使仅使用适度的计算资源,也能为低资源语言带来显著提升。本工作提出的训练课程所取得的BLEU分数,相较基于相同骨干架构训练的监督和NMT,在英语到古吉拉特语上提高了+12.2 BLEU,在英语到哈萨克语上提高了+3.7 BLEU,展示了弱监督NMT对低资源语言的潜力。当在监督数据上训练时,我们的训练课程在索马里语数据集上取得了新的最先进结果(索马里语到英语BLEU为29.3)。我们还观察到,增加训练时间与GPU数量可进一步提升性能,这凸显了在机器翻译研究中报告计算资源使用的重要性。
引用
@article{arxiv.2103.13272,
title = {Low-Resource Machine Translation Training Curriculum Fit for Low-Resource Languages},
author = {Garry Kuwanto and Afra Feyza Akyürek and Isidora Chara Tourni and Siyang Li and Alexander Gregory Jones and Derry Wijaya},
journal= {arXiv preprint arXiv:2103.13272},
year = {2021}
}