中文

EthioMT:面向低资源埃塞俄比亚语言的平行语料库

计算与语言 2024-03-29 v1

摘要

自然语言处理(NLP)领域的近期研究在机器翻译(MT)、新闻分类和问答等高资源语言任务中取得了令人瞩目的性能。然而,对于低资源语言,机器翻译的性能仍有待提高。这是由于这些语言可用的平行语料库规模较小,甚至根本不存在此类语料库。由于缺乏用于包括机器翻译在内的NLP任务的公开可用数据集,埃塞俄比亚语言的NLP同样面临这些问题。为了帮助研究界并促进对埃塞俄比亚语言的研究,我们引入了EthioMT——一个涵盖15种语言的新平行语料库。我们还通过收集埃塞俄比亚研究较为充分的语言的数据集,建立了一个新的基准。我们使用transformer和微调方法对23种埃塞俄比亚语言的新收集语料库和基准数据集进行了评估。

关键词

引用

@article{arxiv.2403.19365,
  title  = {EthioMT: Parallel Corpus for Low-resource Ethiopian Languages},
  author = {Atnafu Lambebo Tonja and Olga Kolesnikova and Alexander Gelbukh and Jugal Kalita},
  journal= {arXiv preprint arXiv:2403.19365},
  year   = {2024}
}

备注

Accepted at The Fifth workshop on Resources for African Indigenous Languages (RAIL) 2024 ( LREC-COLING 2024)