ReGal:探索基于 PPO 的印度法律 AI 在判决预测与摘要生成中的应用
计算与语言
2025-12-23 v1 人工智能
机器学习
摘要
本文 presented 对印度语境下法律人工智能中强化学习方法的初步探索。我们提出基于强化学习的法律推理框架(ReGal),其集成了多任务指令调优与基于 AI反馈的强化学习(RLAIF),并采用近端策略优化(PPO)方法。该框架在两个关键法律任务上进行评估:(i)法院判决预测与解释(CJPE),和(ii)法律文档摘要。尽管该框架在标准评估指标上不及监督学习和专有模型,但它为应用于法律文本的强化学习提供了宝贵的洞见。这些洞见包括奖励模型对齐、法律语言的复杂性以及领域特定的适应性挑战。通过经验和定性分析,我们展示了如何将强化学习重新用于法律领域的高风险、长文档任务。我们的发现为未来利用强化学习优化法律推理管道奠定了基础,更广泛地意味着构建可解释且自适应的法律 AI 系统。
引用
@article{arxiv.2512.18014,
title = {ReGal: A First Look at PPO-based Legal AI for Judgment Prediction and Summarization in India},
author = {Shubham Kumar Nigam and Tanuj Tyagi and Siddharth Shukla and Aditya Kumar Guru and Balaramamahanthi Deepak Patnaik and Danush Khanna and Noel Shallum and Kripabandhu Ghosh and Arnab Bhattacharya},
journal= {arXiv preprint arXiv:2512.18014},
year = {2025}
}
备注
Accepted in AILaw @ AAAI 2026 conference