中文

LiteMat:一种面向大规模 RDF 图的可扩展、高性价比推理编码方案

数据库 2015-10-13 v1

摘要

链接数据源的数量和链接开放数据图的规模与日俱增。因此,语义 RDF 服务正越来越多地面临各种“大数据”问题。存在推理时的查询处理便是其中之一。例如,为了补全 SPARQL 查询的回答集,RDF 数据库系统通过耗时的查询重写算法或占空间的数据物化方案来评估语义 RDFS 关系(subPropertyOf、subClassOf)。为了减少内存占用并便利大型数据集的交换,这些系统通常采用字典方法,通过将资源标识符(IRI)、空白节点和字面量替换为整数值来压缩三元组数据大小。在本文中,我们提出了一种结构化资源标识方案,利用对概念和属性层级的巧妙编码,在最小化三元组物化与查询重写的同时高效评估主要的常见 RDFS 蕴含规则。我们将展示该编码如何能通过可扩展的并行算法计算,并可直接在 Apache Spark 框架上实现。我们的编码方案的高效性通过分别在合成和真实世界数据集上进行的评估得到强调。

关键词

引用

@article{arxiv.1510.03409,
  title  = {LiteMat: a scalable, cost-efficient inference encoding scheme for large RDF graphs},
  author = {Olivier Curé and Hubert Naacke and Tendry Randriamalala and Bernd Amann},
  journal= {arXiv preprint arXiv:1510.03409},
  year   = {2015}
}

备注

8 pages, 1 figure