中文

CAIL2018:面向判决预测的大规模法律数据集

计算与语言 2018-07-09 v1

摘要

在本文中,我们介绍了中国人工智能与法律挑战赛数据集(CAIL2018),这是首个用于判决预测的大规模中文法律数据集。该数据集包含由中国最高人民法院发布的超过 2.62.6 万起刑事案件,其规模是现有判决预测工作中其他数据集的数倍。此外,判决结果的标注更为详细和丰富。它由适用的法律条文、罪名和刑期组成,这些结果需根据案件事实描述进行推断。为进行比较,我们实现了若干传统的文本分类基线方法用于判决预测,实验结果表明,当前模型预测法律案件的判决结果(尤其是刑期)仍具挑战性。为帮助研究者在法律判决预测上取得进展,CAIL2018 数据集与基线方法将在 CAIL 竞赛后发布\footnote{http://cail.cipsc.org.cn/}。

关键词

引用

@article{arxiv.1807.02478,
  title  = {CAIL2018: A Large-Scale Legal Dataset for Judgment Prediction},
  author = {Chaojun Xiao and Haoxi Zhong and Zhipeng Guo and Cunchao Tu and Zhiyuan Liu and Maosong Sun and Yansong Feng and Xianpei Han and Zhen Hu and Heng Wang and Jianfeng Xu},
  journal= {arXiv preprint arXiv:1807.02478},
  year   = {2018}
}

备注

4 pages, 2 tables