中文

探讨大语言模型在分步法律推理中的局限性

计算与语言 2025-02-11 v1

摘要

大语言模型的推理能力近年来是研究的热门焦点。在具有独特细微差别的推理领域中,法律推理是一个具有挑战性的领域,需要在应用规则和先例的同时,谨慎地平衡演绎推理与类比推理,并处理规则之间的冲突。尽管已有少数研究尝试运用大语言模型进行法律推理,但其关注点主要集中在整体准确率上。本文深入分析,进行分步推理,揭示其错误发生的具体环节。我们采用来自《民事程序》数据集的大学水平多选问答(MCQA)任务,提出一种新颖的错误分类体系,基于对多种大语言模型推理链的初始手动分析,包含两个客观指标:可靠性得分和正确性得分。随后,我们开发了一个基于大语言模型的自动评估框架,用于识别推理错误并评估大语言模型的性能。使用该自动评估框架对数据集上的可靠性和正确性得分计算揭示了若干有趣的见解。此外,我们展示将错误分类体系作为反馈纳入流行的提示技术后,大语言模型的性能仅有所轻微提升。我们的工作还将作为一种可用于逻辑密集型复杂任务推理链详细错误分析的评估框架。

关键词

引用

@article{arxiv.2502.05675,
  title  = {Investigating the Shortcomings of LLMs in Step-by-Step Legal Reasoning},
  author = {Venkatesh Mishra and Bimsara Pathiraja and Mihir Parmar and Sat Chidananda and Jayanth Srinivasa and Gaowen Liu and Ali Payani and Chitta Baral},
  journal= {arXiv preprint arXiv:2502.05675},
  year   = {2025}
}

备注

Accepted to NAACL 2025 Findings