IslamicMMLU:用于评估LLM在伊斯兰知识方面表现的基准测试
计算与语言
2026-04-06 v2
摘要
大型语言模型日益被用于伊斯兰知识查询,但尚无综合性基准测试对其在核心伊斯兰学科中的表现进行评估。我们引入IslamicMMLU,这是一个包含10,013个多选题的基准测试,覆盖三个轨道:Quran(2,013个问题)、Hadith(4,000个问题)和Fiqh(4,000个问题)。每个轨道由多种问题类型组成,以检验LLM处理不同方面伊斯兰知识的能力。该基准测试用于创建IslamicMMLU公开排行榜,用于评估LLM的性能,我们最初评估了26个LLM,其中其在三个轨道上的平均准确率在39.8%至93.8%(以Gemini 3 Flash为最高)之间。Quran轨道显示出最广的分散范围(99.3%至32.4%),而Fiqh轨道包括一种新型的madhab(伊斯兰宗教学派偏好检测)任务,揭示了不同模型在学派思想偏好上的差异。阿拉伯语特定模型表现混合,但均低于前沿模型。评估代码和排行榜已公开发布。
引用
@article{arxiv.2603.23750,
title = {IslamicMMLU: A Benchmark for Evaluating LLMs on Islamic Knowledge},
author = {Ali Abdelaal and Mohammed Nader Al Haffar and Mahmoud Fawzi and Walid Magdy},
journal= {arXiv preprint arXiv:2603.23750},
year = {2026}
}
备注
Leaderboard link: https://huggingface.co/spaces/islamicmmlu/leaderboard