中文

面向大语言模型的多语言功能评估

计算与语言 2026-03-13 v2

摘要

大语言模型的多语言能力通常通过静态数据基准(如Belebele、M-MMLU和M-GSM)进行评估。然而,这些评估通常无法充分理解模型在多语言环境中的实际性能和鲁棒性。为此,我们创建了多语言功能基准——跨语言小学数学符号(CL-GSM Symbolic)和跨语言指令遵循评估(CL-IFEval)——通过将现有的功能基准模板从英语翻译成另外五种涵盖自然语言处理可用资源范围的语言:法语、西班牙语、印地语、阿拉伯语和约鲁巴语。我们的结果表明,一些静态多语言基准捕捉功能性能的程度比其他基准更接近(即,在模型间,英语、法语和西班牙语中M-GSM和CL-GSM Symbolic之间的性能分别下降了24%、17%和18%;类似地,Belebele和CL-IFEval之间跨语言的性能下降了15%到24%,而M-MMLU和CL-IFEval之间仅下降了0.5%到3%)。同样,我们发现模型在不同语言上的鲁棒性差异很大,某些语言(例如阿拉伯语、英语)在多次评估迭代中表现最为稳定。

关键词

引用

@article{arxiv.2506.20793,
  title  = {Multi-lingual Functional Evaluation for Large Language Models},
  author = {Victor Ojewale and Inioluwa Deborah Raji and Suresh Venkatasubramanian},
  journal= {arXiv preprint arXiv:2506.20793},
  year   = {2026}
}

备注

This is an updated version with details of the CL-GSM Symbolic and CL-IFEval datasets validation