中文

EthioLLM:面向埃塞俄比亚语言的多语言大语言模型及任务评估

计算与语言 2024-06-25 v4

摘要

大语言模型(LLMs)近期因其在各类下游自然语言处理(NLP)任务中的出色表现而广受欢迎。然而,由于训练 LLMs 的资源不足,低资源语言在当前 NLP 领域的最先进(SOTA)发展中仍然落后。埃塞俄比亚语言展现出显著的语言多样性,包含多种文字系统,并蕴含深厚的宗教和文化意义。本文介绍了 EthioLLM——面向五种埃塞俄比亚语言(阿姆哈拉语、吉兹语、阿凡奥罗莫语、索马里语和提格里尼亚语)和英语的多语言大语言模型,以及 Ethiobenchmark——一个用于各种下游 NLP 任务的新基准数据集。我们评估了这些模型在五个下游 NLP 任务上的性能。我们开源了我们的多语言语言模型、用于各种下游任务的新基准数据集以及特定任务微调的语言模型,并讨论了模型的性能。我们的数据集和模型可在 https://huggingface.co/EthioNLP 仓库获取。

关键词

引用

@article{arxiv.2403.13737,
  title  = {EthioLLM: Multilingual Large Language Models for Ethiopian Languages with Task Evaluation},
  author = {Atnafu Lambebo Tonja and Israel Abebe Azime and Tadesse Destaw Belay and Mesay Gemeda Yigezu and Moges Ahmed Mehamed and Abinew Ali Ayele and Ebrahim Chekol Jibril and Michael Melese Woldeyohannis and Olga Kolesnikova and Philipp Slusallek and Dietrich Klakow and Shengwu Xiong and Seid Muhie Yimam},
  journal= {arXiv preprint arXiv:2403.13737},
  year   = {2024}
}

备注

Accepted at LREC-Coling 2024