衡量大语言模型中的多步法律推理与链律思考效应
人工智能
2025-11-21 v3
摘要
大语言模型(LLMs)在专业领域展现出强大的推理能力,推动了其在法律推理领域的应用研究。然而,现有法律基准常将事实记忆与真正推理混为一谈,碎片化地划分推理过程,且忽视推理质量的考量。为此,我们提出 MSLR,即首个基于现实司法决策的中文多步法律推理数据集。MSLR 采用 IRAC 框架(Issue、Rule、Application、Conclusion)建模来自官方法律文件的结构化专家推理。在此基础上,我们设计了可扩展的人类-LLM 协作标注管道,高效生成细粒度的步骤级推理标注,提供面向多步推理数据集的方法学框架。评估多个 LLM 在 MSLR 上的表现显示,其表现仅 moderately,凸显适应复杂法律推理的挑战。进一步实验表明,由模型自主生成的自发链律思考提示词能提升推理连贯性和质量,超越人类设计的提示词。MSLR 为推动 LLM 推理与链律思考策略的发展提供了资源,同时为后续研究开放数据集和代码(https://github.com/yuwenhan07/MSLR-Bench 和 https://law.sjtu.edu.cn/flszyjzx/index.html)。
引用
@article{arxiv.2511.07979,
title = {Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models},
author = {Wenhan Yu and Xinbo Lin and Lanxin Ni and Jinhua Cheng and Lei Sha},
journal= {arXiv preprint arXiv:2511.07979},
year = {2025}
}
备注
21 pages, 7 figures