中文

非洲语言上的 LLM 性能评估

计算与语言 2025-06-05 v2

摘要

非洲的丰富语言遗产在 NLP 中仍未得到充分代表,这主要归因于历史政策优先外来语言并造成显著数据不平等。在本文中,我们将对非洲语言版图的理论见解与实证评估相结合,使用 Sahara——这是一个来自大规模公开数据集的综合性基准,捕捉大陆语言的多样性。通过系统评估领先的大型语言模型(LLMs)在 Sahara 上的表现,我们展示政策导致的数据变异如何直接影响非洲语言模型的效果。我们的发现表明,尽管少数语言表现相对良好,但许多原住民语言因数据稀缺而被边缘化。借助这些见解,我们提供了可行的政策改革和包容性数据实践的建议。总体而言,本工作强调了迫切需要一种双重方法——结合理论理解与实证评估——以培育面向非洲社区的 AI 语言多样性。

关键词

引用

@article{arxiv.2502.19582,
  title  = {Where Are We? Evaluating LLM Performance on African Languages},
  author = {Ife Adebara and Hawau Olamide Toyin and Nahom Tesfu Ghebremichael and AbdelRahim Elmadany and Muhammad Abdul-Mageed},
  journal= {arXiv preprint arXiv:2502.19582},
  year   = {2025}
}