中文

评估大型语言模型在伊斯兰法律推理上的能力:来自继承法评估的证据

计算与语言 2025-09-18 v2 人工智能

摘要

本文评估了大型语言模型在伊斯兰继承法(即 'ilm al-mawarith)方面的知识和推理能力。我们使用一个包含 1000 道多项选择题的基准测试集,评估了七个 LLM 的性能,该测试集涵盖了多种继承场景,旨在测试模型理解继承语境并计算伊斯兰教法规定份额分配的能力。结果揭示了显著的性能差距:o3 和 Gemini 2.5 的准确率超过 90%,而 ALLaM、Fanar、LLaMA 和 Mistral 的得分低于 50%。这些差异反映了推理能力和领域适应性方面的重要差异。我们进行了详细的错误分析,以识别模型间反复出现的失败模式,包括对继承场景的误解、法律规则的不正确应用以及领域知识不足。我们的发现凸显了处理结构化法律推理的局限性,并为提升伊斯兰法律推理性能指明了方向。代码:https://github.com/bouchekif/inheritance_evaluation

关键词

引用

@article{arxiv.2509.01081,
  title  = {Assessing Large Language Models on Islamic Legal Reasoning: Evidence from Inheritance Law Evaluation},
  author = {Abdessalam Bouchekif and Samer Rashwani and Heba Sbahi and Shahd Gaben and Mutaz Al-Khatib and Mohammed Ghaly},
  journal= {arXiv preprint arXiv:2509.01081},
  year   = {2025}
}

备注

10 pages, 7 Tables, Code: https://github.com/bouchekif/inheritance_evaluation