EthioMT:面向低资源埃塞俄比亚语言的平行语料库
计算与语言
2024-03-29 v1
摘要
自然语言处理(NLP)领域的近期研究在机器翻译(MT)、新闻分类和问答等高资源语言任务中取得了令人瞩目的性能。然而,对于低资源语言,机器翻译的性能仍有待提高。这是由于这些语言可用的平行语料库规模较小,甚至根本不存在此类语料库。由于缺乏用于包括机器翻译在内的NLP任务的公开可用数据集,埃塞俄比亚语言的NLP同样面临这些问题。为了帮助研究界并促进对埃塞俄比亚语言的研究,我们引入了EthioMT——一个涵盖15种语言的新平行语料库。我们还通过收集埃塞俄比亚研究较为充分的语言的数据集,建立了一个新的基准。我们使用transformer和微调方法对23种埃塞俄比亚语言的新收集语料库和基准数据集进行了评估。
引用
@article{arxiv.2403.19365,
title = {EthioMT: Parallel Corpus for Low-resource Ethiopian Languages},
author = {Atnafu Lambebo Tonja and Olga Kolesnikova and Alexander Gelbukh and Jugal Kalita},
journal= {arXiv preprint arXiv:2403.19365},
year = {2024}
}
备注
Accepted at The Fifth workshop on Resources for African Indigenous Languages (RAIL) 2024 ( LREC-COLING 2024)