中文

协作知识图谱的非参数类完备性估计器——以 Wikidata 为例

数据库 2019-11-11 v1 社会与信息网络

摘要

协作知识图谱平台允许人类与自动化脚本协作创建、更新和互联实体与事实。为确保数据的完备性以及不同主题的统一覆盖,识别知识图谱中代表性不足的类至关重要。在本文中,我们通过开发用于协作知识图谱平台的类基数估计统计技术来解决此问题。我们的方法能够估计一个类(由模式或本体定义)的完备性,因此可用于回答诸如“知识库是否拥有所有{啤酒品牌|火山|视频游戏机}的完整列表?”之类的问题。作为一个用例,我们聚焦于 Wikidata,其在本体规模、主动填充图谱的用户数量以及极其动态的特性方面带来了独特挑战。我们的技术源自物种估计与数据管理方法学,并应用于图与协作编辑的场景。在我们的经验评估中,我们观察到:i) 唯一类实例的数量与频率极大地影响估计器的性能;ii) 插入突发若未妥善处理会导致某些估计器高估类的真实规模;iii) 可通过考量估计器相对于可用实例数量的稳定性来有效度量一个类向其真实规模的收敛。

关键词

引用

@article{arxiv.1909.01109,
  title  = {Non-Parametric Class Completeness Estimators for Collaborative Knowledge Graphs -- The Case of Wikidata},
  author = {Michael Luggen and Djellel Difallah and Cristina Sarasua and Gianluca Demartini and Philippe Cudré-Mauroux},
  journal= {arXiv preprint arXiv:1909.01109},
  year   = {2019}
}