中文

揭示维基百科分类的语义

信息检索 2019-07-01 v1 人工智能 数据库

摘要

维基百科分类图作为 YAGO 或 Probase 等大规模知识图谱的分类主干,并已被广泛用于实体消歧或语义相似度估计等任务。维基百科的分类是分类学信息与非分类学信息的丰富来源。例如,分类“German science fiction writers”编码了其资源的类型(Writer)、国籍(German)和体裁(Science Fiction)。文献中的若干方法利用了该编码信息的一部分,而未充分挖掘其全部潜力。本文提出一种发现分类公理的方法,利用来自分类网络、分类实例及其词汇化的信息。以 DBpedia 作为背景知识,我们发现了覆盖维基百科 502k 个分类的 703k 条公理,并以分别超过 87% 和 90% 的精度向 DBpedia 知识图谱补充了 4.4M 条关系断言和 3.3M 条类型断言。

关键词

引用

@article{arxiv.1906.12089,
  title  = {Uncovering the Semantics of Wikipedia Categories},
  author = {Nicolas Heist and Heiko Paulheim},
  journal= {arXiv preprint arXiv:1906.12089},
  year   = {2019}
}

备注

Preprint of a research track paper at the International Semantic Web Conference (ISWC) 2019, Auckland, NZ