中文

DocRED:一个大规模文档级关系抽取数据集

计算与语言 2019-08-12 v3

摘要

文档中的多个实体通常表现出复杂的句间关系,现有关系抽取(RE)方法通常聚焦于抽取单一实体对的句内关系,难以妥善处理此类关系。为加速文档级RE研究,我们提出DocRED,一个基于Wikipedia和Wikidata构建的新数据集,具有三个特点:(1)DocRED同时标注命名实体与关系,是从纯文本构建的最大人工标注文档级RE数据集;(2)DocRED需要阅读文档中多个句子,通过综合文档全部信息来抽取实体并推断其关系;(3)除人工标注数据外,我们还提供大规模远程监督数据,使DocRED可用于监督与弱监督两种场景。为验证文档级RE的挑战性,我们实现了近期最先进的RE方法,并在DocRED上对这些方法进行了全面评估。实验结果表明,现有RE方法在DocRED上面临挑战,说明文档级RE仍是一个开放问题,需进一步努力。基于实验的详细分析,我们讨论了多个有前景的未来研究方向。

关键词

引用

@article{arxiv.1906.06127,
  title  = {DocRED: A Large-Scale Document-Level Relation Extraction Dataset},
  author = {Yuan Yao and Deming Ye and Peng Li and Xu Han and Yankai Lin and Zhenghao Liu and Zhiyuan Liu and Lixin Huang and Jie Zhou and Maosong Sun},
  journal= {arXiv preprint arXiv:1906.06127},
  year   = {2019}
}

备注

Accepted by ACL 2019