中文

Unilaw-R1:基于强化学习与迭代推理的法律推理大语言模型

计算与语言 2025-12-09 v2

摘要

尽管推理导向的大语言模型(LLM)正在快速演进,但其在处理复杂法律问题方面的能力仍未得到充分探索。本文我们提出Unilaw-R1,这是一个专为法律推理设计的大语言模型。该模型在70亿参数规模上实现了轻量化,显著降低了部署成本,同时有效应对法律领域的三个核心挑战:法律知识不足、推理逻辑不可靠以及业务泛化能力弱。为此,我们首先构建Unilaw-R1-Data,包含1.7万个提炼筛选后的链式思维(CoT)样本的高质量数据集。基于此,我们采用结合监督微调(SFT)和强化学习(RL)的两阶段训练策略,显著提升了在复杂法律推理任务上的性能,支持法律AI应用中可解释的决策。为评估法律推理能力,我们还引入Unilaw-R1-Eval,一个专为评估单选与多选法律任务而设计的专项基准。Unilaw-R1在权威基准测试上表现突出,超越了规模相似的所有模型,并与规模更大的DeepSeek-R1-Distill-Qwen-32B(54.9%)达到相当水平。在完成领域特定训练后,它在LawBench和LexEval上的表现显著提升,平均超过Qwen-2.5-7B-Instruct(46.6%)6.6个百分点。

关键词

引用

@article{arxiv.2510.10072,
  title  = {Unilaw-R1: A Large Language Model for Legal Reasoning with Reinforcement Learning and Iterative Inference},
  author = {Hua Cai and Shuang Zhao and Liang Zhang and Xuli Shen and Qing Xu and Weilin Shen and Zihao Wen and Tianke Ban},
  journal= {arXiv preprint arXiv:2510.10072},
  year   = {2025}
}