中文

MultiLoKo:面向 LLMs 的多语言本地知识基准

计算与语言 2025-04-16 v2

摘要

我们提出 MultiLoKo,这是一个新的基准,用于评估大语言模型(LLM)的多语言能力,覆盖 31 种语言。MultiLoKo 包含三个部分:一个由每种语言各自提供 500 个问题组成的主部分,这些问题在特定语言上具有本地相关性;以及两个翻译部分,包含来自 30 种非英语语言到英语以及反之人工翻译。为进行比较,我们也发布了相应的机器翻译。数据在两个子集中均匀分布:一个开发子集和一个盲测(out-of-distribution)测试子集。MultiLoKo 可用于研究关于 LLM 多语言性的各种问题,以及关于多语言基准创建的元问题。我们对 11 个基础模型和聊天模型进行了 MultiLoKo 评分,这些模型都宣称自己是多语言的,并研究了它们的平均性能、跨语言的性能平等性、问题语言对回答能力的影响,以及哪些语言最具挑战性。我们所研究的模型在 MultiLoKo 上表现不佳,表现为低的平均分以及最佳和最差语言之间的最大差距。此外,我们发现问题语言对模型表现有显著影响,表明不同语言之间的知识传递存在次优情况。最后,我们发现使用本地数据与英语翻译数据会导致最佳模型的得分相差超过 20 分,大幅改变某些语言难度的估计。对于使用机器翻译的情况,我们发现其对语言难度排序影响较弱,导致模型排名差异更大,所有模型的估计性能都会显著下降。

关键词

引用

@article{arxiv.2504.10356,
  title  = {MultiLoKo: a multilingual local knowledge benchmark for LLMs spanning 31 languages},
  author = {Dieuwke Hupkes and Nikolay Bogoychev},
  journal= {arXiv preprint arXiv:2504.10356},
  year   = {2025}
}