KazMMLU:面向哈萨克语的 MMLU 评估基准
计算与语言
2025-07-22 v2
摘要
尽管哈萨克斯坦人口达到两千万,但其文化和语言在自然语言处理领域仍被严重低估。尽管大型语言模型(LLM)在全球范围内不断进步,但在哈萨克语方面的应用进展有限,主要体现在缺乏专门模型和评估基准。为弥合这一差距,我们引入了 KazMMLU,这是第一个专为哈萨克语设计的 MMLU 风格数据集。KazMMLU 包含 23,000 题,覆盖多个教育阶段,涵盖 STEM、人文和社会科学等领域,数据来源于真实的教育材料,并由 native speaker 和教育工作者人工验证。数据集中包含 10,969 题哈萨克语问题和 12,031 题俄语问题,反映了哈萨克斯坦双语教育体系及其丰富的本地语境。我们对若干前沿多语言模型(Llama-3.1、Qwen-2.5、GPT-4 和 DeepSeek V3)进行评估,发现即使是表现最好的模型在哈萨克语和俄语方面也难以达到竞争水平。这些发现凸显了与高资源语言之间的显著性能差距。我们希望该数据集能促进哈萨克语导向的大型语言模型的进一步研究与开发。数据和代码将在接受后公开。
引用
@article{arxiv.2502.12829,
title = {KazMMLU: Evaluating Language Models on Kazakh, Russian, and Regional Knowledge of Kazakhstan},
author = {Mukhammed Togmanov and Nurdaulet Mukhituly and Diana Turmakhan and Jonibek Mansurov and Maiya Goloburda and Akhmed Sakip and Zhuohan Xie and Yuxia Wang and Bekassyl Syzdykov and Nurkhan Laiyk and Alham Fikri Aji and Ekaterina Kochmar and Preslav Nakov and Fajri Koto},
journal= {arXiv preprint arXiv:2502.12829},
year = {2025}
}