中文

LAG-MMLU:评估前沿大语言模型在拉脱维亚语和吉里亚马语中的理解能力

计算与语言 2025-03-19 v2

摘要

随着大语言模型(LLM)的快速发展,评估其性能至关重要。LLM在多语言数据上进行训练,但其推理能力主要使用英语数据集进行评估。因此,需要使用高质量的非英语数据集,尤其是低资源语言(LRLs),来建立稳健的评估框架。本研究使用由母语者策划的、兼顾语言与文化相关性的超大规模多任务语言理解(MMLU)子集,对八种最先进(SOTA)LLM在拉脱维亚语和吉里亚马语上的表现进行了评估。吉里亚马语首次被纳入基准测试。我们的评估结果显示,OpenAI的o1模型在所有语言上均优于其他模型,在0-shot任务上英语得分为92.8%,拉脱维亚语为88.8%,吉里亚马语为70.8%。Mistral-large(35.6%)和Llama-70B IT(41%)在拉脱维亚语和吉里亚马语上表现较弱。我们的结果强调了建立本地化基准和人工评估对于推进文化AI语境化的必要性。

关键词

引用

@article{arxiv.2503.11911,
  title  = {LAG-MMLU: Benchmarking Frontier LLM Understanding in Latvian and Giriama},
  author = {Naome A. Etori and Kevin Lu and Randu Karisa and Arturs Kanepajs},
  journal= {arXiv preprint arXiv:2503.11911},
  year   = {2025}
}

备注

Accepted at NoDaLiDa/Baltic-HLT 2025. https://hdl.handle.net/10062/107190