PalmX 2025:关于在阿拉伯和伊斯兰文化上对 LLM 进行基准测试的首届共享任务
计算与语言
2025-09-03 v1
摘要
大型语言模型(LLM)固有地反映了其在预训练阶段遇到的海量数据分布。由于这些数据主要来源于网络,因此极有可能偏向高资源语言和文化,例如西方的语言和文化。因此,LLM 对某些群体的理解往往表现出不足,这一差距在其对阿拉伯和伊斯兰文化的知识中尤为明显。随着主题越来越缺乏代表性,这一问题变得更加突出。为了应对这一关键挑战,我们引入了 PalmX 2025,这是首个旨在对 LLM 在这些特定领域的文化能力进行基准测试的共享任务。该任务由两个子任务组成,包含现代标准阿拉伯语(MSA)的选择题:一般阿拉伯文化和一般伊斯兰文化。这些子任务涵盖了来自 22 个阿拉伯国家的广泛主题,包括传统、食物、历史、宗教习俗和语言表达。该倡议引起了广泛关注,共有 26 支队伍注册参加子任务 1,19 支队伍注册参加子任务 2,最终分别收到 9 份和 6 份有效提交。我们的研究结果表明,特定任务的微调显著提升了基线模型的性能。表现最好的系统在文化问题上达到了 72.15% 的准确率,在伊斯兰知识上达到了 84.22% 的准确率。参数高效微调成为参与者中最主要且最有效的方法,而数据增强的效用被发现是依赖于领域的。
引用
@article{arxiv.2509.02550,
title = {PalmX 2025: The First Shared Task on Benchmarking LLMs on Arabic and Islamic Culture},
author = {Fakhraddin Alwajih and Abdellah El Mekki and Hamdy Mubarak and Majd Hawasly and Abubakr Mohamed and Muhammad Abdul-Mageed},
journal= {arXiv preprint arXiv:2509.02550},
year = {2025}
}
备注
https://palmx.dlnlp.ai/