一种利用单语数据改进低资源神经机器翻译的混合方法
计算与语言
2021-11-23 v3 机器学习
摘要
许多语言对属于低资源,意味着可用平行数据的数量和/或质量不足以训练出能达到可接受准确度的神经机器翻译(NMT)模型。许多工作探索了利用两种语言中一种或两种均易获得的单语数据,以改进低资源甚至高资源语言翻译模型的标准。其中最为成功的此类工作之一是反向翻译,它利用目标语言单语数据的翻译来增加训练数据量。已有研究表明,在可用平行数据上训练的反向模型的质量决定了反向翻译方法的性能。尽管如此,在标准反向翻译中,仅有前向模型在单语目标数据上得到改进。先前一项研究提出了一种迭代反向翻译方法,以在多次迭代中改进两个模型。但与传统的反向翻译不同,它同时依赖于目标和源单语数据。因此,本工作提出了一种新颖方法,通过分别混合自学习与反向翻译,使反向与前向模型均能受益于单语目标数据。实验结果表明,所提方法在英语-德语低资源神经机器翻译上优于传统反向翻译方法。我们还提出了一种迭代自学习方法,其性能优于迭代反向翻译,同时仅依赖于单语目标数据且所需训练的模型更少。
引用
@article{arxiv.2011.07403,
title = {A Hybrid Approach for Improved Low Resource Neural Machine Translation using Monolingual Data},
author = {Idris Abdulmumin and Bashir Shehu Galadanci and Abubakar Isa and Habeebah Adamu Kakudi and Ismaila Idris Sinan},
journal= {arXiv preprint arXiv:2011.07403},
year = {2021}
}
备注
16 pages, 4 figures, 10 Tables