AfroBench:大型语言模型在非洲语言上的表现如何?
计算与语言
2025-06-10 v5 人工智能
机器学习
摘要
诸如 MEGA 之类的大规模多语言评测,由于高质量评测数据的稀缺以及现有非洲数据集的可发现性有限,往往仅包含少数非洲语言。这种代表性的缺失阻碍了对多种语言和任务下 LLM 的全面评估。为应对这些挑战,我们引入了 AfroBench——一个用于评估 LLM 在 64 种非洲语言、15 项任务和 22 个数据集上表现的多任务基准。AfroBench 由九个自然语言理解数据集、六个文本生成数据集、六个知识与问答任务以及一个数学推理任务组成。我们给出了提示 LLM 与基于 BERT 和 T5 风格模型的微调基线之间性能的比较结果。我们的结果表明,在大多数任务中,英语等高资源语言与非洲语言之间存在巨大的性能差距;但性能也随单语数据资源的可获得性而变化。我们的发现证实,非洲语言上的性能仍是当前 LLM 的障碍,突显了缩小这一差距所需付出的额外努力。https://mcgill-nlp.github.io/AfroBench/
引用
@article{arxiv.2311.07978,
title = {AfroBench: How Good are Large Language Models on African Languages?},
author = {Jessica Ojo and Odunayo Ogundepo and Akintunde Oladipo and Kelechi Ogueji and Jimmy Lin and Pontus Stenetorp and David Ifeoluwa Adelani},
journal= {arXiv preprint arXiv:2311.07978},
year = {2025}
}
备注
Accepted to ACL 2025 (Findings)