答案(仍)为何及如何正确?动态知识图谱中的溯源维护
数据库
2020-07-30 v1
摘要
知识图谱(KGs)日益成为许多关键知识型应用的支柱。实践中使用的大多数大规模 KG 是基于对多样数据源应用抽取技术集成而自动构建的。因此,为查询结果建立溯源以确定其计算方式十分重要。溯源已被证明可用于为结果分配置信度分数、调试 KG 生成过程以及提供答案解释。在这类应用中,某些查询作为持续查询被注册,因为其答案常被需要。然而,由于源数据变化、抽取技术改进、信息精炼/ enrichment 等原因,KG 持续不断变化。这引出了一个问题:对于动态且大规模的 KG,如何高效维护复杂图模式查询的溯源多项式,而非每次 KG 更新时都从头重算。针对这些问题,我们提出 HUKA,其利用溯源多项式通过编码生成答案所涉及的边来追踪 KG 上查询结果的推导。更重要的是,HUKA 还能在面对底层 KG 的更新——事实的插入与删除——时维护这些溯源多项式。在 YAGO 和 DBpedia 等大型真实 KG 上、采用多种基准 SPARQL 查询负载的实验结果表明,HUKA 在动态 KG 的溯源计算上可比现有系统快近 50 倍。
引用
@article{arxiv.2007.14864,
title = {How and Why is An Answer (Still) Correct? Maintaining Provenance in Dynamic Knowledge Graphs},
author = {Garima Gaur and Arnab Bhattacharya and Srikanta Bedathur},
journal= {arXiv preprint arXiv:2007.14864},
year = {2020}
}