中文

构建卢干达语与英语平行语料库并训练翻译模型

计算与语言 2023-01-10 v1

摘要

神经机器翻译(NMT)在大规模数据集上取得了巨大成功,因此 NMT 更多地建立在高资源语言的基础之上。由于缺乏高质量的平行语料库,这持续制约着卢干达语等低资源语言的发展,以至于在本文撰写之时,连“Google 翻译”都不支持卢干达语。在本文中,我们基于三个不同的开源语料库,构建了包含 41,070 个句对的卢干达语与英语平行语料库。随后,我们在该数据集上通过超参数搜索训练了 NMT 模型。实验得到的 BLEU 分数分别为卢干达语到英语 21.28 和英语到卢干达语 17.47。一些翻译示例显示出较高的翻译质量。我们相信我们的模型是首个卢干达语-英语 NMT 模型。我们构建的双语数据集将向公众开放。

关键词

引用

@article{arxiv.2301.02773,
  title  = {Building a Parallel Corpus and Training Translation Models Between Luganda and English},
  author = {Richard Kimera and Daniela N. Rim and Heeyoul Choi},
  journal= {arXiv preprint arXiv:2301.02773},
  year   = {2023}
}