S2RDF:在 Spark 上使用 SPARQL 进行 RDF 查询
数据库
2016-01-28 v3 分布式、并行与集群计算
摘要
RDF 因其灵活且通用的图状数据模型,在语义数据发布中已变得非常流行。然而,RDF 数据集合不断增长的规模使得在单机上存储和处理它们越来越不可行,从而产生了对分布式方法的需求。我们赞成使用现有的大数据处理基础设施(例如 Hadoop),而非构建独立但封闭的分布式 RDF 存储。然而,SPARQL 查询性能是一大挑战,因为这些平台并非从根本上为 RDF 处理而设计。因此,现有的基于 Hadoop 的方法往往偏爱某些查询模式形状,而对其他形状性能显著下降。本文中,我们描述一种称为 ExtVP 的 RDF 数据新型关系分区模式,它使用基于半连接的预处理(类似于关系数据库中连接索引的概念)来有效最小化查询输入大小,而不管其模式形状和直径。我们的原型系统 S2RDF 构建于 Spark 之上,并使用其关系接口在 ExtVP 上执行 SPARQL 查询。我们使用近期的 WatDiv 测试套件,展示了其相较于最先进的 SPARQL-on-Hadoop 方法的优越性能。S2RDF 在十亿三元组 RDF 图上对大多数查询实现了亚秒级运行时间。
引用
@article{arxiv.1512.07021,
title = {S2RDF: RDF Querying with SPARQL on Spark},
author = {Alexander Schätzle and Martin Przyjaciel-Zablocki and Simon Skilevic and Georg Lausen},
journal= {arXiv preprint arXiv:1512.07021},
year = {2016}
}