LeCaRDv2:大规模中文法律案例检索数据集
计算与语言
2023-10-27 v1 信息检索
摘要
作为智能法律系统的重要组成部分,法律案例检索在保障司法公正中发挥着关键作用。然而,中文法律体系下法律案例检索技术的发展受限于现有数据集的三个问题:数据规模有限、法律相关性定义狭窄,以及数据采样中使用的朴素候选池化策略。为缓解这些问题,我们推出了 LeCaRDv2,一个大规模法律案例检索数据集(第 2 版)。它由从 430 万份刑事案件文书中提取的 800 个查询和 55,192 个候选组成。据我们所知,LeCaRDv2 是最大的中文法律案例检索数据集之一,提供了对罪名广泛的覆盖。此外,我们通过考虑三个关键方面——特征、刑罚、程序——丰富了现有的相关性标准。这一综合标准丰富了数据集并可能提供更整体的视角。进一步地,我们提出了一种两级候选集池化策略,可有效识别每个查询案例的潜在候选。需注意,数据集中所有案例均由多位专攻刑法的法律专家标注。他们的专业知识确保了标注的准确与可靠。我们在 LeCaRDv2 上评估了若干 SOTA 检索模型,表明法律案例检索仍有显著改进空间。LeCaRDv2 的详情可见于匿名网站 https://github.com/anonymous1113243/LeCaRDv2。
引用
@article{arxiv.2310.17609,
title = {LeCaRDv2: A Large-Scale Chinese Legal Case Retrieval Dataset},
author = {Haitao Li and Yunqiu Shao and Yueyue Wu and Qingyao Ai and Yixiao Ma and Yiqun Liu},
journal= {arXiv preprint arXiv:2310.17609},
year = {2023}
}