通过隐式知识提高去中心化链接数据查询的召回率
数据库
2015-03-19 v1
摘要
除了集中式地爬取、索引和查询RDF数据外,链接数据原则允许通过解引用URI来即时处理SPARQL查询。针对链接数据提出的链接遍历查询方法具有结果最新和去中心化(即客户端)执行的优势,但它们仅基于解引用文档中可用的不完整知识进行操作,从而影响了召回率。在本文中,我们研究了隐式知识——特别是通过owl:sameAs和RDFS推理发现的知识——如何能在该设置下提高召回率。我们首先对包含4百万个链接数据源和11亿个四元组的大规模爬取进行了实证分析:我们(1)仅考虑可解引用信息来测量预期召回率,(2)像先前的方法那样,测量考虑rdfs:seeAlso链接所带来的召回率提升。我们进一步提出并测量了额外考虑(3) owl:sameAs链接,以及(4)应用轻量级RDFS推理(具体为{\rho}DF)以依赖静态模式信息来发现更多结果所产生的影响。我们针对爬取数据评估了我们的实时查询方法。
引用
@article{arxiv.1109.0181,
title = {Improving the recall of decentralised linked data querying through implicit knowledge},
author = {Jürgen Umbrich and Aidan Hogan and Axel Polleres},
journal= {arXiv preprint arXiv:1109.0181},
year = {2015}
}