中文

AI 语言熟练度监测器——跟踪 LLM 在多语言基准测试中的进展

计算与语言 2025-07-14 v1

摘要

为确保大语言模型(LLM)的福利可及性至关重要,这需要对其在世界各地语言中的能力进行评估。我们引入 AI 语言熟练度监测器,一项全面的多语言基准测试,系统性地评估 LLM 在最高可达 200 种语言中的表现,尤其关注资源匮乏的语言。该基准测试聚合了包括翻译、问答、数学和推理在内的多样化任务,采用数据集如 FLORES+、MMLU、GSM8K、TruthfulQA 和 ARC。我们提供开源、自动更新的排行榜和仪表盘,支持研究人员、开发者和政策制定者识别模型的优势与不足。除了排名外,该平台还提供描述性见解,如全球熟练度地图和随时间变化的趋势。通过补充并扩展先前的多语言基准测试,我们的工作旨在促进多语言 AI 的透明度、包容性与进步。该系统已在 https://huggingface.co/spaces/fair-forward/evals-for-every-language 提供服务。

关键词

引用

@article{arxiv.2507.08538,
  title  = {The AI Language Proficiency Monitor -- Tracking the Progress of LLMs on Multilingual Benchmarks},
  author = {David Pomerenke and Jonas Nothnagel and Simon Ostermann},
  journal= {arXiv preprint arXiv:2507.08538},
  year   = {2025}
}