ChiKhaPo:面向大语言模型词汇理解与生成的大规模多语言基准
机器学习
2025-10-21 v1
摘要
现有大语言模型 (LLM) 基准主要局限于高或中资源语言,常在推理与生成等高阶任务上进行评估。然而,大量证据表明,LLM 在世界上 3800 多种书面语言中缺乏基础语言能力。我们引入 ChiKhaPo,包含 8 subtasks,难度各异,旨在评估生成式模型的词汇理解与生成能力。ChiKhaPo 基于现有词典、单语数据和双语数据,涵盖 2700 多种语言,为 2 个 subtasks 提供覆盖,超越了任何现有基准的语言覆盖范围。我们进一步表明 6 个最先进模型在本基准上表现不佳,并讨论影响得分的因素,包括语言族、语言资源稀缺性、任务类型以及理解与生成方向。随着 ChiKhaPo 的推出,我们希望能够推动并鼓励对大语言模型进行大规模多语言基准测试。
引用
@article{arxiv.2510.16927,
title = {Closing the Curvature Gap: Full Transformer Hessians and Their Implications for Scaling Laws},
author = {Egor Petrov and Nikita Kiselev and Vladislav Meshkov and Andrey Grabovoy},
journal= {arXiv preprint arXiv:2510.16927},
year = {2025}
}
备注
38 pages, 12 figures. Submitted to ICLR 2026