中文

ArabLegalEval:评估大语言模型阿拉伯语法律知识的多任务基准

计算与语言 2025-10-08 v1 人工智能 计算机与社会

摘要

大语言模型(LLMs)的快速发展带来了各种自然语言处理任务的显著进步。然而,对LLMs法律知识的评估,特别是在阿拉伯语等非英语语言中,仍然探索不足。为解决这一空白,我们引入了ArabLegalEval,一个用于评估LLMs阿拉伯语法律知识的多任务基准数据集。受MMLU和LegalBench数据集的启发,ArabLegalEval包含多个源自沙特法律文件和合成问题的任务。在这项工作中,我们旨在分析解决阿拉伯语法律问题所需的能力,并对最先进的LLMs进行性能基准测试。我们探索了上下文学习的影响,并研究了各种评估方法。此外,我们还探索了通过自动验证生成问题以提升数据集质量的工作流程。我们分别对多语言和以阿拉伯语为中心的LLMs(如GPT-4和Jais)进行了基准测试。我们还分享了创建数据集和验证的方法,该方法可推广到其他领域。我们希望通过发布ArabLegalEval数据集和代码来加速阿拉伯语法律领域的AI研究:https://github.com/Thiqah/ArabLegalEval

关键词

引用

@article{arxiv.2408.07983,
  title  = {ArabLegalEval: A Multitask Benchmark for Assessing Arabic Legal Knowledge in Large Language Models},
  author = {Faris Hijazi and Somayah AlHarbi and Abdulaziz AlHussein and Harethah Abu Shairah and Reem AlZahrani and Hebah AlShamlan and Omar Knio and George Turkiyyah},
  journal= {arXiv preprint arXiv:2408.07983},
  year   = {2025}
}