LLM legal mathematical reasoning:通过两阶段强化学习实现程序性对齐
计算与语言
2025-06-10 v2
摘要
法律数学推理是将大型语言模型 (LLM) 应用于高风险法律领域的关键因素,要求其输出既要在数学上准确,又要符合程序性要求。然而,现有的法律 LLM 缺乏结构化的数值推理能力,而开放领域模型虽具计算能力,却常常忽视强制性的法律步骤。为此,我们提出了 LexNum,即首个中文法律数学推理基准,涵盖三个具有代表性的情景,其中每个实例都反映了法律依据的程序流程。我们进一步提出了 LexPam,一个用于高效法律推理训练的两阶段强化学习框架。利用课程学习,我们使用更强大的教师模型将数据划分为基础子集和挑战子集。随后,对一个轻量级 1.5B 参数的学生模型进行群体相对策略优化 (Group Relative Policy Optimization),该方法避免了昂贵的价值网络,实现了从稀疏的序列结束奖励进行稳定训练。第一阶段提高了准确率和格式;第二阶段引入了新颖的奖励,以引导通过任务特定法律元素实现程序对齐。实验表明,现有模型在 LexNum 上表现不佳,而 LexPam 提升了数学准确率和法律连贯性,并在不同任务和领域中实现了良好的泛化。
引用
@article{arxiv.2504.02590,
title = {Legal Mathematical Reasoning with LLMs: Procedural Alignment through Two-Stage Reinforcement Learning},
author = {Kepu Zhang and Guofu Xie and Weijie Yu and Mingyue Xu and Xu Tang and Yaxin Li and Jun Xu},
journal= {arXiv preprint arXiv:2504.02590},
year = {2025}
}