JuDGE:中国法律系统判决文书生成的基准测试
计算与语言
2025-05-01 v3 人工智能
信息检索
摘要
本文介绍了 JuDGE(Judgment Document Generation Evaluation,判决文书生成评估),这是一个用于评估中国法律系统中判决文书生成性能的新型基准。我们将该任务定义为根据给定的案件事实描述生成完整的法律判决书。为了构建该基准,我们构建了一个全面的数据集,包含来自真实法律案件的事实描述及其对应的完整判决书,作为评估生成文书质量的真实标签。该数据集还通过两个外部法律语料库进行了增强,为任务提供额外的法律知识:一个包含法律条文和法规,另一个包含大量过去的判决书。我们与法律专业人士合作,建立了一个全面的自动化评估框架,从多个维度评估生成判决文书的质量。我们评估了多种基线方法,包括少样本上下文学习、微调以及多源检索增强生成(RAG)方法,并使用了通用和法律领域的 LLM。实验结果表明,尽管 RAG 方法可以有效提升该任务的性能,但仍有很大的改进空间。所有代码和数据集均可在 https://github.com/oneal2000/JuDGE 获取。
引用
@article{arxiv.2503.14258,
title = {JuDGE: Benchmarking Judgment Document Generation for Chinese Legal System},
author = {Weihang Su and Baoqing Yue and Qingyao Ai and Yiran Hu and Jiaqi Li and Changyue Wang and Kaiyuan Zhang and Yueyue Wu and Yiqun Liu},
journal= {arXiv preprint arXiv:2503.14258},
year = {2025}
}