中文

DialectalArabicMMLU:面向阿拉伯语及多语言语言模型的方言能力基准测试

计算与语言 2026-03-24 v2 人工智能

摘要

我们提出DialectalArabicMMLU,一个用于评估大型语言模型(LLM)在阿拉伯语方言及多语言环境下的性能的新基准。虽然最近开发的阿拉伯语和多语言基准已推动了针对现代标准阿拉伯语(MSA)的LLM评估,但尽管方言变体在日常交流中占据主导地位,却在评估基准中被低估。DialectalArabicMMLU通过对3K个多选问答对进行人工翻译和适配,扩展至叙利亚、埃及、阿联酋、沙特和摩洛哥五大主要方言,总计15K个问答对,覆盖32个学术和专业领域(包括英文和MSA共计22K个问答对)。该基准实现了对LLM推理与理解能力的系统性评估,支持基于任务和语言分析。我们评估了19个开源阿拉伯语和多语言LLM(参数规模1B至13B),报告了各方言间的显著性能差异,揭示了方言泛化能力的持续差距。DialectalArabicMMLU提供了第一个统一、人工审核的资源,用于衡量阿拉伯语方言理解能力,从而推动更包容的评估与模型发展。

关键词

引用

@article{arxiv.2510.27543,
  title  = {DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models},
  author = {Malik H. Altakrori and Nizar Habash and Abed Alhakim Freihat and Younes Samih and Kirill Chirkunov and Muhammed AbuOdeh and Radu Florian and Teresa Lynn and Preslav Nakov and Alham Fikri Aji},
  journal= {arXiv preprint arXiv:2510.27543},
  year   = {2026}
}

备注

9 pages, 10 tables, accepted to LREC 2026