中文

基于法律问题树评估法律推理轨迹

人工智能 2026-05-04 v2 计算与语言

摘要

在 expert domains(如法律)中评估大语言模型生成的推理轨迹质量,对于确保其可信度和可解释性至关重要,但由于推理任务的内在复杂性,这仍然具有挑战性。我们引入 LEGIT(LEGal Issue Trees),一个新型大规模(24K 实例)的 expert-level 法律推理数据集,着重于推理轨迹评估。我们将法院判决转化为对立当事方论点及法院裁决的层次化树结构,这些树结构作为评估推理覆盖范围和正确性的评语标准。通过人类 expert 注释和与粗糙、信息不充分的评语标准进行比较,我们验证了这些评语标准的可靠性。利用 LEGIT 数据集,我们展示了:(1) 大语言模型的法律推理能力严重受到法律问题覆盖率和正确性的影响;(2) 检索增强生成(RAG)和基于评语的强化学习(RL)对法律推理能力带来了互补的优势,其中 RAG 改进整体推理能力,而 RL 提升正确性但会降低覆盖率。

关键词

引用

@article{arxiv.2512.01020,
  title  = {Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics},
  author = {Jinu Lee and Kyoung-Woon On and Simeng Han and Arman Cohan and Julia Hockenmaier},
  journal= {arXiv preprint arXiv:2512.01020},
  year   = {2026}
}

备注

ACL 2026 Main Conference