中文

ALARB:阿拉伯法律论证推理基准

计算与语言 2025-10-02 v1 人工智能 信息检索

摘要

我们引入 ALARB,一个数据集和任务套件,旨在评估大语言模型(LLM)在阿拉伯法律领域的推理能力。虽然现有的阿拉伯基准涵盖了一些知识密集型任务,如检索和理解,但专门针对阿拉伯 LLM 多步推理的大规模数据集仍然缺乏,尤其是在开放语境中。该数据集包含来自沙特阿拉伯的 13,000 多起商业法庭案例,每起案例包括呈现的事实、法庭推理、判决以及从监管文件中提取的引用条款。我们定义了一组具有挑战性的任务,利用该数据集反映真实世界法律推理的复杂性,包括判决预测、多步法律论证中推理链的补全以及基于案件事实识别相关法规。我们对当前主流开源和闭源阿拉伯 LLM 在这些任务上进行了基准测试,并展示了该数据集在指令微调中的效用。值得注意的是,我们表明使用 ALARB 对一个适度的 12B 参数模型进行指令微调,可显著提升其在判决预测和阿拉伯语判决生成方面的性能,达到与 GPT-4o 相当的水平。

关键词

引用

@article{arxiv.2510.00694,
  title  = {ALARB: An Arabic Legal Argument Reasoning Benchmark},
  author = {Harethah Abu Shairah and Somayah AlHarbi and Abdulaziz AlHussein and Sameer Alsabea and Omar Shaqaqi and Hebah AlShamlan and Omar Knio and George Turkiyyah},
  journal= {arXiv preprint arXiv:2510.00694},
  year   = {2025}
}

备注

Accepted paper at ArabicNLP 2025