中文

评估用于法律推理的测试时缩放 LLM:OpenAI o1、DeepSeek-R1 及未来展望

计算与语言 2025-11-11 v2

摘要

大语言模型(LLMs)测试时缩放的近期进展(以 DeepSeek-R1 和 OpenAI 的 o1 为代表)表明,在推理期间扩展思维链可以显著提升通用推理性能。然而,这一范式对法律推理的影响仍未得到充分探索。为填补这一空白,我们首次对 12 个 LLM 进行了系统评估,包括专注于推理的模型和通用模型,涵盖了跨越成文法和判例法传统的 17 个中文和英文法律任务。此外,我们通过从 DeepSeek-R1 蒸馏,策划了一个用于法律推理的双语思维链数据集,并开发了 Legal-R1,这是一个专门针对法律领域的开源模型。实验结果表明,Legal-R1 在多种任务中表现出色。DeepSeek-R1 在中文法律推理中表现出明显优势,而 OpenAI 的 o1 在英文任务中取得了相当的结果。我们进一步进行了详细的错误分析,揭示了反复出现的问题,如过时的法律知识、有限的法律解释能力以及易产生事实幻觉。这些发现勾勒了法律领域 LLM 面临的主要障碍,并为未来研究提出了有前景的方向。

关键词

引用

@article{arxiv.2503.16040,
  title  = {Evaluating Test-Time Scaling LLMs for Legal Reasoning: OpenAI o1, DeepSeek-R1, and Beyond},
  author = {Yinghao Hu and Yaoyao Yu and Leilei Gan and Bin Wei and Kun Kuang and Fei Wu},
  journal= {arXiv preprint arXiv:2503.16040},
  year   = {2025}
}

备注

23 pages, Published in Findings of the Association for Computational Linguistics: EMNLP 2025