中文

ChiKhaPo:大规模多语言基准测试用于评估大语言模型的词汇理解与生成

计算与语言 2025-12-01 v2

摘要

现有的大语言模型(LLM)基准测试大多局限于高或中资源语言,常在推理和生成等高阶任务中进行评估。然而,大量证据表明,LLM 在世界上 3800 多种书面语言的绝大多数语言中缺乏基本的语言能力。我们引入 ChiKhaPo,包含 8 subtasks,难度各异,旨在评估生成式模型的词汇理解与生成能力。ChiKhaPo 基于现有词典、单语数据和双语数据,涵盖 2700 多种语言的 2 个 subtasks,超越了现有基准测试在语言覆盖范围方面的表现。我们进一步表明,6 个最先进模型在本基准测试中表现不佳,并讨论影响得分的因素,包括语言族、语言资源稀缺性、任务类型以及理解与生成方向。有了 ChiKhaPo,我们希望能够并鼓励对大语言模型进行大规模多语言基准测试。

关键词

引用

@article{arxiv.2510.16928,
  title  = {ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models},
  author = {Emily Chang and Niyati Bafna},
  journal= {arXiv preprint arXiv:2510.16928},
  year   = {2025}
}