中文

GlotEval:面向大规模多语言大语言模型评估的测试套件

计算与语言 2025-10-09 v2

摘要

大语言模型 (LLM) 正在全球范围内以前所未有的速度发展,地区日益采纳这些模型用于其主要语言的应用。对这些模型在多样化语言环境中的评估,尤其是针对低资源语言的评估,已成为学术界和行业的主要挑战。现有的评估框架在英语和少数几种高资源语言上进行评估,从而忽略了大语言模型在多语言和低资源场景下的真实性能。为填补这一差距,我们引入 GlotEval,一个用于大规模多语言评估的轻量级框架。GlotEval 支持七个关键任务(机器翻译、文本分类、摘要生成、开放式生成、阅读理解、序列标注和内在评估),覆盖数十到数百种语言,GlotEval 突出显示了一致的多语言基准测试、语言特定的提示模板和非英语中心的机器翻译。这使我们能够在多样化语言语境中精确诊断模型的优势与不足。一个多语言翻译案例研究表明,GlotEval 适用于多语言和语言特定的评估。

关键词

引用

@article{arxiv.2504.04155,
  title  = {GlotEval: A Test Suite for Massively Multilingual Evaluation of Large Language Models},
  author = {Hengyu Luo and Zihao Li and Joseph Attieh and Sawal Devkota and Ona de Gibert and Xu Huang and Shaoxiong Ji and Peiqin Lin and Bhavani Sai Praneeth Varma Mantina and Ananda Sreenidhi and Raúl Vázquez and Mengjie Wang and Samea Yusofi and Fei Yuan and Jörg Tiedemann},
  journal= {arXiv preprint arXiv:2504.04155},
  year   = {2025}
}

备注

EMNLP demo 2025