揭示维基百科分类的语义
信息检索
2019-07-01 v1 人工智能
数据库
摘要
维基百科分类图作为 YAGO 或 Probase 等大规模知识图谱的分类主干,并已被广泛用于实体消歧或语义相似度估计等任务。维基百科的分类是分类学信息与非分类学信息的丰富来源。例如,分类“German science fiction writers”编码了其资源的类型(Writer)、国籍(German)和体裁(Science Fiction)。文献中的若干方法利用了该编码信息的一部分,而未充分挖掘其全部潜力。本文提出一种发现分类公理的方法,利用来自分类网络、分类实例及其词汇化的信息。以 DBpedia 作为背景知识,我们发现了覆盖维基百科 502k 个分类的 703k 条公理,并以分别超过 87% 和 90% 的精度向 DBpedia 知识图谱补充了 4.4M 条关系断言和 3.3M 条类型断言。
引用
@article{arxiv.1906.12089,
title = {Uncovering the Semantics of Wikipedia Categories},
author = {Nicolas Heist and Heiko Paulheim},
journal= {arXiv preprint arXiv:1906.12089},
year = {2019}
}
备注
Preprint of a research track paper at the International Semantic Web Conference (ISWC) 2019, Auckland, NZ