重新审视低资源神经机器翻译:案例研究
计算与语言
2019-05-29 v1
摘要
已有研究表明,神经机器翻译(NMT)在低资源条件下的性能急剧下降,其表现不如基于短语的统计机器翻译(PBSMT),并且需要大量辅助数据才能取得有竞争力的结果。在本文中,我们重新评估这些结果的有效性,认为它们是系统未适应低资源设置所导致的。我们讨论了训练低资源 NMT 系统时需要注意的一些陷阱,以及在低资源设置中已被证明特别有效的一些最新技术,从而形成了一套低资源 NMT 的最佳实践。在我们使用不同数量 IWSLT14 训练数据进行的德英实验中,我们表明,在不使用任何辅助单语或多语言数据的情况下,经过优化的 NMT 系统所需的数据量远少于此前声称的量即可优于 PBSMT。我们还将这些技术应用于一个低资源韩英数据集,以 4 BLEU 超越了此前报告的结果。
引用
@article{arxiv.1905.11901,
title = {Revisiting Low-Resource Neural Machine Translation: A Case Study},
author = {Rico Sennrich and Biao Zhang},
journal= {arXiv preprint arXiv:1905.11901},
year = {2019}
}
备注
to appear at ACL 2019