TurkishMMLU:衡量大规模多任务语言理解 in Turkish
计算与语言
2024-10-04 v2
摘要
多选题问答任务用于评估大型语言模型 (LLM) 的推理、理解和数学能力。虽然现有基准测试使用自动翻译进行多语言评估,但这种方法容易出错,可能在社会科学领域引入文化偏见。我们介绍第一个多任务、多选题土耳其语问答基准测试,TurkishMMLU,用于评估 LLM 对土耳其语语言的理解。TurkishMMLU 包含超过 1 万道题目,覆盖土耳其高中教育课程中的 9 个学科。这些题目由课程专家撰写,符合土耳其高中课程要求,涵盖从自然科学和数学题目到更具文化代表性的主题,如土耳其文学和土耳其共和国历史。我们评估了超过 20 个 LLM,包括多语言开源模型 (如 Gemma、Llama、MT5)、封闭源模型 (GPT-4o、Claude、Gemini) 以及土耳其适配模型 (如 Trendyol)。我们提供了广泛的评估,包括零-shot 和 few-shot 评估、链式思考推理以及问题难度分析,并对模型性能进行了分析。我们对当前 LLM 在土耳其语言方面的能力和局限性进行了深入分析,以为未来针对土耳其语言的 LLM 提供见解。我们公开发布了数据集和评估代码:https://github.com/ArdaYueksel/TurkishMMLU。
引用
@article{arxiv.2407.12402,
title = {TurkishMMLU: Measuring Massive Multitask Language Understanding in Turkish},
author = {Arda Yüksel and Abdullatif Köksal and Lütfi Kerem Şenel and Anna Korhonen and Hinrich Schütze},
journal= {arXiv preprint arXiv:2407.12402},
year = {2024}
}
备注
EMNLP 2024 - Findings