中文

LEVEN:大规模中文法律事件检测数据集

计算与语言 2022-03-17 v1 人工智能

摘要

事实认定是作出判断的最基础步骤,因此检测法律文档中的事件对法律案例分析任务十分重要。然而,现有的法律事件检测(LED)数据集仅关注不全面的事件类型且标注数据有限,这制约了 LED 方法及其下游应用的发展。为缓解这些问题,我们提出 LEVEN——一个大规模中文法律事件检测数据集(LEgal eVENt detection),包含 8,116 篇法律文档及 150,977 个人工标注的、涵盖 108 种事件类型的事件提及。除罪名相关事件外,LEVEN 还覆盖通用事件,这类事件对法律案件理解至关重要却在现有 LED 数据集中被忽视。据我们所知,LEVEN 是最大的 LED 数据集,其数据规模是其他数据集的数十倍,将显著促进 LED 方法的训练与评估。大量实验结果表明 LED 具有挑战性且需进一步研究。此外,我们简单地将法律事件作为辅助信息以促进下游应用。该方法在低资源判决预测中平均精度提升 2.2 点,在无监督案件检索中平均精度均值提升 1.5 点,表明 LED 的基础性。源代码与数据集可从 https://github.com/thunlp/LEVEN 获取。

关键词

引用

@article{arxiv.2203.08556,
  title  = {LEVEN: A Large-Scale Chinese Legal Event Detection Dataset},
  author = {Feng Yao and Chaojun Xiao and Xiaozhi Wang and Zhiyuan Liu and Lei Hou and Cunchao Tu and Juanzi Li and Yun Liu and Weixing Shen and Maosong Sun},
  journal= {arXiv preprint arXiv:2203.08556},
  year   = {2022}
}

备注

Accepted to ACL2022 Findings