思考更长,并不总是更聪明:评估LLM在层次化法律推理中的能力
计算与语言
2026-01-21 v2
摘要
基于案例的推理是美国法律实践的基石,要求专业人员通过对过去案例的类比和区分来论证当前案件。尽管大型语言模型(LLMs)已显示出惊人的能力,但其在这种复杂且细致的推理方面的熟练程度仍需进一步调查。我们提出了一个将识别案件之间显著区别的过程分解为三个阶段推理任务的正式框架。我们的框架使用称为因子的事实谓词来建模案件,将其组织成法律知识层次结构,并定义用于识别区别、分析其论证支持和评估其显著性的可验证规则。通过对现代推理LLM的全面评估,我们揭示了一个悖论:尽管模型在表面级推理(任务1)上实现了高准确率,但在层次化推理(任务2:64.82%-92.09%)和综合分析(任务3:11.46%-33.99%)上的表现会降低。最令人震惊的是,我们发现模型在错误响应上消耗更多的计算资源,而在正确响应上则消耗较少,这表明“思考更久”并不总是“更聪明”。我们的工作为对LLM在复杂领域中推理能力进行细粒度分析提供了方法,并揭示了必须解决的根本性限制,以实现稳健可信的法律AI。
引用
@article{arxiv.2510.08710,
title = {Thinking Longer, Not Always Smarter: Evaluating LLM Capabilities in Hierarchical Legal Reasoning},
author = {Li Zhang and Matthias Grabmair and Morgan Gray and Kevin Ashley},
journal= {arXiv preprint arXiv:2510.08710},
year = {2026}
}
备注
15 pages, 7 figures, Proceedings of the 2026 Symposium on Computer Science and Law (CSLAW '26)