中文

CJRC:一个可靠的人工标注中文司法阅读理解基准数据集

计算与语言 2019-12-21 v1 机器学习

摘要

我们提出了一个中文司法阅读理解(CJRC)数据集,包含约 10K 文档和近 50K 带答案的问题。文档来源于裁判文书,问题由法律专家标注。CJRC 数据集可帮助研究者通过阅读理解技术抽取要素。要素抽取是法律领域的一项重要任务。然而,由于文档类型和案由的多样性,难以完全预定义要素类型。相比之下,机器阅读理解技术可通过回答长文档中的各类问题快速抽取要素。我们基于 BERT 和 BiDAF 构建了两个强基线模型。实验结果表明,相较于人工标注者仍有充足的改进空间。

关键词

引用

@article{arxiv.1912.09156,
  title  = {CJRC: A Reliable Human-Annotated Benchmark DataSet for Chinese Judicial Reading Comprehension},
  author = {Xingyi Duan and Baoxin Wang and Ziyue Wang and Wentao Ma and Yiming Cui and Dayong Wu and Shijin Wang and Ting Liu and Tianxiang Huo and Zhen Hu and Heng Wang and Zhiyuan Liu},
  journal= {arXiv preprint arXiv:1912.09156},
  year   = {2019}
}