ArabicMMLU:评估阿拉伯语的大规模多任务语言理解
计算与语言
2024-07-31 v2
摘要
随着大模型预训练的进步,语言模型评估的重点已转向推理和知识密集型任务。尽管最先进 (SOTA) 的模型部分是在大型阿拉伯语文本上训练的,但由于相关数据集的有限可用性,评估其在阿拉伯语上的性能仍然具有挑战性。为了弥合这一差距,我们推出了\datasetname{},这是首个面向阿拉伯语的多任务语言理解基准,其数据源自北非、黎凡特和海湾地区不同国家各级学校的考试。我们的数据集包含 40 个任务和 14,575 道现代标准阿拉伯语 (MSA) 选择题,并由与该地区母语人士合作精心构建。我们对 35 个模型的全面评估显示,仍有巨大的改进空间,尤其是在最好的开源模型中。值得注意的是,BLOOMZ、mT0、LLaMA2 和 Falcon 的得分难以达到 50%,而即使表现最好的以阿拉伯语为中心的模型也仅达到 62.3% 的得分。
引用
@article{arxiv.2402.12840,
title = {ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic},
author = {Fajri Koto and Haonan Li and Sara Shatnawi and Jad Doughman and Abdelrahman Boda Sadallah and Aisha Alraeesi and Khalid Almubarak and Zaid Alyafeai and Neha Sengupta and Shady Shehata and Nizar Habash and Preslav Nakov and Timothy Baldwin},
journal= {arXiv preprint arXiv:2402.12840},
year = {2024}
}
备注
Findings of ACL 2024