中文

English2Gbe:面向{Fon/Ewe}Gbe的多语言机器翻译模型

计算与语言 2021-12-23 v1

摘要

语言是解放的本质要素。遗憾的是,两千余种非洲语言中大多数为低资源语言。学界近期使用机器翻译来复兴与加强若干非洲语言。然而,所训练模型常为双语,导致覆盖所有可能翻译方向需训练与维护的模型数量潜在指数增长。此外,双语模型未利用部分语言间的相似性。因此,多语言神经机器翻译(NMT)正获得相当关注,尤其针对低资源语言。尽管如此,学界对其采用仍有限。本文介绍English2Gbe,一个能从英语译为Ewe或Fon的多语言NMT模型。使用Sacrebleu(Post, 2018)包计算的BLEU、CHRF和TER分数以保证可复现性,我们展示English2Gbe优于双语模型(英语到Ewe及英语到Fon),并在Nekoto等人(2020)建立的JW300基准上给出Fon的SOTA结果。我们希望本工作有助于学界大规模采用多语言模型。我们的代码已在Github上公开。

关键词

引用

@article{arxiv.2112.11482,
  title  = {English2Gbe: A multilingual machine translation model for {Fon/Ewe}Gbe},
  author = {Gilles Hacheme},
  journal= {arXiv preprint arXiv:2112.11482},
  year   = {2021}
}