中文

面向关系抽取的文档覆盖度预测

计算与语言 2021-11-29 v1 人工智能

摘要

本文提出了一项预测文本文档对于关系抽取(RE)覆盖度的新任务:该文档是否包含给定实体的许多关系元组?覆盖度预测有助于从大规模输入语料库中为知识库构建选择最佳文档。为了研究这一问题,我们提供了一个包含 520 个实体的 31,366 篇多样化文档的数据集。我们分析了文档覆盖度与长度、实体提及频率、Alexa 排名、语言复杂度以及信息检索得分等特征之间的相关性。这些特征中的每一个都仅具有中等的预测能力。我们采用了将特征与 TF-IDF 等统计模型及 BERT 等语言模型相结合的方法。结合特征与 BERT 的模型 HERB 达到了高达 46% 的 F1 分数。我们在两个用例上展示了覆盖度预测的效用:知识库构建和声明反驳。

关键词

引用

@article{arxiv.2111.13611,
  title  = {Predicting Document Coverage for Relation Extraction},
  author = {Sneha Singhania and Simon Razniewski and Gerhard Weikum},
  journal= {arXiv preprint arXiv:2111.13611},
  year   = {2021}
}

备注

To appear in TACL. The arXiv version is a pre-MIT Press publication version