中文

TUMLU: 突厥语族统一且原生语言理解基准

计算与语言 2025-06-16 v2 人工智能

摘要

全面评估大规模多任务语言理解(MMLU)能力对于推进多语言语言模型的适用性至关重要。然而,以高质量原生语言准备此类基准往往成本高昂,从而限制了评估数据集的代表性。尽管近期努力致力于构建更具包容性的MMLU基准,但这些基准通常使用机器翻译从高资源语言构建,这可能引入错误且未能考虑目标语言的形态句法和文化特性。在本文中,我们解决了突厥语族这一具有独特形态句法和文化特征的被代表性不足的语言家族中原生语言MMLU基准的缺失问题。我们为突厥语族MMLU提出了两个基准:TUMLU是一个全面、多语言且原生开发的语言理解基准,专门面向突厥语族。它包含涵盖阿塞拜疆语、克里米亚鞑靼语、卡拉卡尔帕克语、哈萨克语、鞑靼语、土耳其语、维吾尔语和乌兹别克语共8种语言的初高中水平问题,涉及11个学科。我们还提出了TUMLU-mini,即数据集的一个更简洁、平衡且经过人工验证的子集。使用该数据集,我们系统地评估了包括Claude、Gemini、GPT和LLaMA在内的多种开源和专有多语言大语言模型(LLM),深入分析了它们在不同语言、学科和字母表上的表现。为了促进多语言语言理解领域的进一步研究与发展,我们发布了TUMLU-mini及所有相应的评估脚本。

关键词

引用

@article{arxiv.2502.11020,
  title  = {TUMLU: A Unified and Native Language Understanding Benchmark for Turkic Languages},
  author = {Jafar Isbarov and Arofat Akhundjanova and Mammad Hajili and Kavsar Huseynova and Dmitry Gaynullin and Anar Rzayev and Osman Tursun and Aizirek Turdubaeva and Ilshat Saetov and Rinat Kharisov and Saule Belginova and Ariana Kenbayeva and Amina Alisheva and Abdullatif Köksal and Samir Rustamov and Duygu Ataman},
  journal= {arXiv preprint arXiv:2502.11020},
  year   = {2025}
}

备注

Accepted to ACL 2025, Main Conference