中文

ChiKhaPo:面向大语言模型词汇理解与生成的大规模多语言基准

机器学习 2025-10-21 v1

摘要

现有大语言模型 (LLM) 基准主要局限于高或中资源语言,常在推理与生成等高阶任务上进行评估。然而,大量证据表明,LLM 在世界上 3800 多种书面语言中缺乏基础语言能力。我们引入 ChiKhaPo,包含 8 subtasks,难度各异,旨在评估生成式模型的词汇理解与生成能力。ChiKhaPo 基于现有词典、单语数据和双语数据,涵盖 2700 多种语言,为 2 个 subtasks 提供覆盖,超越了任何现有基准的语言覆盖范围。我们进一步表明 6 个最先进模型在本基准上表现不佳,并讨论影响得分的因素,包括语言族、语言资源稀缺性、任务类型以及理解与生成方向。随着 ChiKhaPo 的推出,我们希望能够推动并鼓励对大语言模型进行大规模多语言基准测试。

关键词

引用

@article{arxiv.2510.16927,
  title  = {Closing the Curvature Gap: Full Transformer Hessians and Their Implications for Scaling Laws},
  author = {Egor Petrov and Nikita Kiselev and Vladislav Meshkov and Andrey Grabovoy},
  journal= {arXiv preprint arXiv:2510.16927},
  year   = {2025}
}

备注

38 pages, 12 figures. Submitted to ICLR 2026