知识图中何为正常、何为异常、何为缺失:基于归纳式摘要的统一刻画
人工智能
2020-03-24 v1 信息检索
机器学习
摘要
知识图(KGs)以图的结构存储关于世界的高度异构信息,并可用于问答与推理等任务。然而,它们常包含错误且缺失信息。KG精炼的活跃研究致力于解决这些问题,所定制的技术要么检测特定类型错误,要么补全KG。本工作中,我们通过将问题表述为带一组归纳式软规则的无监督KG摘要,引入KG刻画的统一方案;这些规则描述KG中的正常情形,从而可用于识别异常,无论其是奇怪还是缺失。与一阶逻辑规则不同,我们的规则是带标签的有根图,即基于节点类型与KG中的信息、描述(已见或未见)节点周围期望邻域的模式。我们脱离传统的基于支持度/置信度的规则挖掘技术,提出KGist(Knowledge Graph Inductive SummarizaTion,知识图归纳式摘要),其学习一组最优压缩KG的归纳式规则摘要,依据最小描述长度原理——这一表述我们在KG规则挖掘语境下首创使用。我们将规则应用于三个大型KG(NELL、DBpedia与Yago)以及压缩、各类错误检测与不完整信息识别等任务。我们展示KGist在错误检测与不完全性识别上优于特定任务的有监督与无监督基线(识别出多达93%缺失实体的位置——比基线高逾10%),同时对大型知识图亦高效。
引用
@article{arxiv.2003.10412,
title = {What is Normal, What is Strange, and What is Missing in a Knowledge Graph: Unified Characterization via Inductive Summarization},
author = {Caleb Belth and Xinyi Zheng and Jilles Vreeken and Danai Koutra},
journal= {arXiv preprint arXiv:2003.10412},
year = {2020}
}
备注
10 pages, plus 2 pages of references. 5 figures. Accepted at The Web Conference 2020