中文

面向数字化包容的英-埃菲克语语料库与机器翻译系统开发

计算与语言 2026-03-17 v1

摘要

低资源语言是人类历史宝库,保存着文化和智力多样性。尽管如此,它们仍大多缺失于现代自然语言处理系统中。虽然为广为人知的非洲语言如斯瓦希利语、约鲁巴语和阿姆哈拉语在机器翻译研究中取得了一些进展,但像埃菲克语等较小的土著语言仍在机器翻译研究中被严重低估。本研究评估了最先进的多语言神经机器翻译模型在英-埃菲克翻译中的效果,利用由社区精心 curated 的 13,865 句对平行语料库。我们在该数据集上微调了 mT5 多语言模型和 NLLB200 模型。NLLB-200 在英-埃菲克翻译和埃菲克-英翻译上分别获得了 BLEU 分数为 26.64 和 31.21,chrF 分数分别为 51.04 和 47.92,表明在流畅度和语义忠实度方面取得了改进。我们的发现表明,为低资源语言开发实用机器翻译工具是可行的,并突出了包容性数据实践和文化根基评估在推动公平 NLP 方面的重要性。

关键词

引用

@article{arxiv.2603.14873,
  title  = {Developing an English-Efik Corpus and Machine Translation System for Digitization Inclusion},
  author = {Offiong Bassey Edet and Mbuotidem Sunday Awak and Emmanuel Oyo-Ita and Benjamin Okon Nyong and Ita Etim Bassey},
  journal= {arXiv preprint arXiv:2603.14873},
  year   = {2026}
}

备注

8 pages, 1 figure, accepted at AfricaNLP 2026 (co-located with EACL)