ClaimGen-CN:面向中文法律索赔生成的大规模数据集
计算与语言
2025-10-28 v2 人工智能
摘要
法律索赔指原告在案件中的诉求,对指导司法推理和案件解决具有重要意义。虽然许多研究致力于提高法律专业人员的工作效率,但针对非专业人士(如原告)的研究 remains unexplored。本文探索了基于给定案件事实进行法律索赔生成的问题。首先,我们构建 ClaimGen-CN,这是第一个用于中文法律索赔生成任务的数据集,源自 various real-world legal disputes。此外,我们设计了一种评估生成索赔的度量标准,涵盖两个关键维度:事实准确性和表达清晰性。基于此,我们对 state-of-the-art 的通用模型和法律领域大型语言模型进行了全面的零样本评估。我们的发现表明,当前模型在事实精确性和表达清晰性方面存在局限,指向在该领域需要更有针对性的开发。为鼓励进一步探索这一重要任务,我们将公开此数据集。
引用
@article{arxiv.2508.17234,
title = {ClaimGen-CN: A Large-scale Chinese Dataset for Legal Claim Generation},
author = {Siying Zhou and Yiquan Wu and Hui Chen and Xavier Hu and Kun Kuang and Adam Jatowt and Ming Hu and Chunyan Zheng and Fei Wu},
journal= {arXiv preprint arXiv:2508.17234},
year = {2025}
}