中文

从维基百科列表页中提取实体

信息检索 2020-04-02 v1 计算与语言

摘要

在涉及广泛领域的实事知识时,维基百科通常是网络上最主要的信息来源。DBpedia 和 YAGO 作为大型跨领域知识图谱,通过为维基百科中的每个页面创建一个实体并以边连接它们,对该知识的一部分进行编码。然而,众所周知,基于维基百科的知识图谱远不完整。特别是,由于维基百科的政策仅允许为具有一定知名度的主题建立页面,此类图谱往往缺乏关于不太知名实体的信息。关于这些实体的信息通常在百科全书中可用,但并未以独立页面的形式呈现。在本文中,我们提出了一种两阶段方法,用于从已被证明是宝贵信息来源的维基百科列表页中提取实体。在第一阶段,我们以 DBpedia 为骨干,从分类和列表页构建大型分类法。通过远程监督,我们提取用于识别列表页中新实体的训练数据,并在第二阶段用于训练分类模型。通过该方法,我们提取了超过 70 万个新实体,并以高精度为 DBpedia 扩展了 750 万条新类型语句和 380 万条新事实。

关键词

引用

@article{arxiv.2003.05146,
  title  = {Entity Extraction from Wikipedia List Pages},
  author = {Nicolas Heist and Heiko Paulheim},
  journal= {arXiv preprint arXiv:2003.05146},
  year   = {2020}
}

备注

Preprint of a full paper at European Semantic Web Conference 2020 (ESWC 2020)