MAWARITH:面向大语言模型的法律继承推理数据集与基准
计算与语言
2026-03-18 v2
摘要
伊斯兰继承法('ilm al-mawarith)对大语言模型而言颇具挑战,因为解决继承案件需要复杂的、结构化的多步骤推理,并正确地应用判例法规则来计算继承人份额。我们引入 MAWARITH,一个包含12,500个阿拉伯语继承案例的大规模标注数据集,用于训练和评估模型在完整推理链条过程中的表现:(i)识别合格继承人,(ii)应用阻挡(hajb)与分配规则,(iii)计算准确的继承份额。与以往限制数据集仅能解答多选题不同,MAWARITH支持完整的推理链,并提供逐步解决方案,包括中间法律决策与依据古典判例法来源和已建立继承规则的论证,以及准确的份额计算。为超越最终答案准确率进行评估,我们提出了 MIR-E(Mawarith Inheritance Reasoning Evaluation),一种加权多阶段指标,对关键推理阶段进行评分,捕捉管道中错误的传播。我们以零样本设置评估了六种大语言模型。Gemini-2.5-flash 在验证集和测试集上实现约90%的 MIR-E 得分,而 Fanar-C、Fanar-Sadiq、LLaMA 3 和 Qwen 3 均低于50%。我们的错误分析识别出了包括场景误解、继承人识别错误、份额分配错误以及遗漏或错误应用关键继承规则如 'awl 和 radd 等的常见失败模式。MAWARITH 数据集已公开于 https://gitlab.com/islamgpt1/qias_shared_task_2026。
引用
@article{arxiv.2603.07539,
title = {MAWARITH: A Dataset and Benchmark for Legal Inheritance Reasoning with LLMs},
author = {Abdessalam Bouchekif and Shahd Gaben and Samer Rashwani and Somaya Eltanbouly and Mutaz Al-Khatib and Heba Sbahi and Mohammed Ghaly and Emad Mohamed},
journal= {arXiv preprint arXiv:2603.07539},
year = {2026}
}