非洲语言上的 LLM 性能评估
计算与语言
2025-06-05 v2
摘要
非洲的丰富语言遗产在 NLP 中仍未得到充分代表,这主要归因于历史政策优先外来语言并造成显著数据不平等。在本文中,我们将对非洲语言版图的理论见解与实证评估相结合,使用 Sahara——这是一个来自大规模公开数据集的综合性基准,捕捉大陆语言的多样性。通过系统评估领先的大型语言模型(LLMs)在 Sahara 上的表现,我们展示政策导致的数据变异如何直接影响非洲语言模型的效果。我们的发现表明,尽管少数语言表现相对良好,但许多原住民语言因数据稀缺而被边缘化。借助这些见解,我们提供了可行的政策改革和包容性数据实践的建议。总体而言,本工作强调了迫切需要一种双重方法——结合理论理解与实证评估——以培育面向非洲社区的 AI 语言多样性。
引用
@article{arxiv.2502.19582,
title = {Where Are We? Evaluating LLM Performance on African Languages},
author = {Ife Adebara and Hawau Olamide Toyin and Nahom Tesfu Ghebremichael and AbdelRahim Elmadany and Muhammad Abdul-Mageed},
journal= {arXiv preprint arXiv:2502.19582},
year = {2025}
}