中文

LEEC:一个具有广泛领域专用标签体系的法律要素抽取数据集

计算与语言 2023-10-11 v2 信息检索

摘要

作为自然语言处理中的关键任务,要素抽取在法律领域的重要性日益凸显。从司法文书中抽取法律要素有助于增强对法律案件的解读与分析能力,从而推动法律各领域中大量下游应用。然而,现有的要素抽取数据集受限于法律知识的获取受限以及标签覆盖不足。为弥补这一缺陷,我们引入了一个更全面、大规模的罪名要素抽取数据集,包含 15,831 份司法文书和 159 个标签。该数据集通过两个主要步骤构建:首先,由我们的法律专家团队基于先前法律研究设计标签体系,该研究确定了刑事案件中驱动量刑结果和生成量刑过程的关键要素;其次,依据标签体系和标注指南运用法律知识对司法文书进行标注。法律要素抽取数据集(LEEC)代表了中文法律体系中规模最大、领域最专用的法律要素抽取数据集。利用标注数据,我们采用了多种 SOTA 模型,验证了 LEEC 在文档事件抽取(DEE)任务中的适用性。LEEC 数据集可在 https://github.com/THUlawtech/LEEC 获取。

关键词

引用

@article{arxiv.2310.01271,
  title  = {LEEC: A Legal Element Extraction Dataset with an Extensive Domain-Specific Label System},
  author = {Xue Zongyue and Liu Huanghai and Hu Yiran and Kong Kangle and Wang Chenlu and Liu Yun and Shen Weixing},
  journal= {arXiv preprint arXiv:2310.01271},
  year   = {2023}
}