LLMPR:一种基于 LLM 驱动迁移学习的请愿书排序模型
计算与语言
2025-05-29 v1 人工智能
机器学习
摘要
未决法律案件的持续积压,尤其是在印度司法体系中,严重阻碍了司法的及时交付。人工优先级排序请愿书的方法往往效率低下且存在主观偏见,进一步加剧了延误。为了解决这个问题,我们提出了 LLMPR(基于大语言模型的请愿书排序),这是一个自动化框架,利用迁移学习和机器学习根据上下文紧迫性为法律请愿书分配优先级排序。利用包含 7,593 份标注请愿书的 ILDC 数据集,我们处理非结构化法律文本,并通过各种嵌入技术(包括 DistilBERT、LegalBERT 和 MiniLM)提取特征。这些文本嵌入与间隔天数、排名分数和字数等定量指标相结合,用于训练多种机器学习模型,包括 Random Forest、Decision Tree、XGBoost、LightGBM 和 CatBoost。我们的实验表明,Random Forest 和 Decision Tree 模型产生了卓越的性能,准确率超过 99%,Spearman 秩相关为 0.99。值得注意的是,仅使用数值特征的模型实现了近乎最优的排序结果(R2 = 0.988, \r{ho} = 0.998),而基于 LLM 的嵌入仅提供了微小的增益。这些发现表明,自动化的请愿书排序可以有效简化司法工作流程,减少案件积压,并提高法律优先级排序中的公平性。
引用
@article{arxiv.2505.21689,
title = {LLMPR: A Novel LLM-Driven Transfer Learning based Petition Ranking Model},
author = {Avijit Gayen and Somyajit Chakraborty and Mainak Sen and Soham Paul and Angshuman Jana},
journal= {arXiv preprint arXiv:2505.21689},
year = {2025}
}
备注
28 pages, 5 figures, journal paper, submitted to AI and Law