中文

重访DocRED——解决关系抽取中的假阴性问题

计算与语言 2023-06-19 v3 信息检索

摘要

DocRED数据集是文档级关系抽取(RE)中最流行和广泛使用的基准之一。它采用推荐-修订标注方案以获得大规模标注数据集。然而,我们发现DocRED的标注是不完整的,即假阴性样本普遍存在。我们分析了DocRED数据集中大量假阴性问题的成因与影响。为弥补该缺陷,我们通过将遗漏的关系三元组加回原始DocRED,重新标注了其中的4,053篇文档。我们将修订后的DocRED数据集命名为Re-DocRED。我们在两个数据集上使用最先进(SOTA)神经模型进行了大量实验,实验结果表明在Re-DocRED上训练和评估的模型取得了约13个F1点的性能提升。此外,我们进行了全面分析以识别进一步改进的潜在方向。我们的数据集公开于 https://github.com/tonytan48/Re-DocRED。

关键词

引用

@article{arxiv.2205.12696,
  title  = {Revisiting DocRED -- Addressing the False Negative Problem in Relation Extraction},
  author = {Qingyu Tan and Lu Xu and Lidong Bing and Hwee Tou Ng and Sharifah Mahani Aljunied},
  journal= {arXiv preprint arXiv:2205.12696},
  year   = {2023}
}

备注

Accepted by EMNLP 2022