面向极低资源非洲语言的神经机器翻译:以班巴拉语为例
计算与语言
2020-11-11 v1
摘要
低资源语言给(神经)机器翻译带来了独特挑战。我们讨论班巴拉语的情况,这是一种曼德语族语言,其训练数据稀缺且需要大量预处理。比起班巴拉语自身的语言状况,班巴拉语使用者的社会文化语境对该语言的自动化处理提出了挑战。在本文中,我们提出了首个班巴拉语与英语、法语互译的平行数据集,以及首个班巴拉语互译的机器翻译基准结果。我们讨论了处理低资源语言时的挑战,并提出了应对低资源机器翻译(MT)中数据稀缺的策略。
引用
@article{arxiv.2011.05284,
title = {Neural Machine Translation for Extremely Low-Resource African Languages: A Case Study on Bambara},
author = {Allahsera Auguste Tapo and Bakary Coulibaly and Sébastien Diarra and Christopher Homan and Julia Kreutzer and Sarah Luger and Arthur Nagashima and Marcos Zampieri and Michael Leventhal},
journal= {arXiv preprint arXiv:2011.05284},
year = {2020}
}