中文

GreekMMLU:面向希腊语语言模型的原生来源多任务基准

计算与语言 2026-03-31 v2

摘要

大语言模型(LLM)通常在包含希腊语的多语言语料库上进行训练,但针对希腊语的可靠评估基准——尤其是基于真实、原生来源内容的基准——仍显有限。现有数据集常为从英语机器翻译,无法捕捉希腊语的语言和文化特征。我们引入GreekMMLU,一个用于希腊语大规模多任务语言理解的原生来源基准,包含 21,805 题的多选题,覆盖 45 个学科领域,依据新制定的学科分类体系,并标注了从小学到专业考试的教育难度等级。所有题目均来自或以希腊语撰写,来源于学术、专业和政府考试。我们公开发布 16,857 份样本,保留 4,948 份样本作为私人排行榜,以实现稳健且免受数据污染的评估。对 80 多款开源和闭源 LLM 的评估显示,前沿模型与开源模型之间存在显著的性能差距,此外,针对希腊语适应的模型与通用多语言模型之间也存在差距。最后,我们系统性地分析了影响性能的因素——包括模型规模、适应程度和提示方式——并为改进希腊语 LLM 能力提供了见解。

关键词

引用

@article{arxiv.2602.05150,
  title  = {GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek},
  author = {Yang Zhang and Mersin Konomi and Christos Xypolopoulos and Konstantinos Divriotis and Konstantinos Skianis and Giannis Nikolentzos and Giorgos Stamou and Guokan Shang and Michalis Vazirgiannis},
  journal= {arXiv preprint arXiv:2602.05150},
  year   = {2026}
}