中文

BigSR:现代大数据平台上实时表达性RDF流推理的实证研究

人工智能 2018-04-13 v1 数据库

摘要

语言表达性与系统可扩展性(E&S)之间的权衡是RDF流推理中一个众所周知的问题。更高的表达性支持更复杂的推理逻辑,但也可能阻碍系统可扩展性。当前研究主要聚焦于适用于流推理的逻辑框架以及原型系统的实现与评估。这些系统通常在集中式环境下开发,受限于固有的有限可扩展性,而关于应用分布式解决方案以兼顾E&S的深入研究仍然缺失。本文旨在探索应用现代分布式计算框架以同时满足E&S的可行性。为此,我们首先提出BigSR,一个支持LARS框架正片段的技术验证器。为通用性并覆盖广泛用例,BigSR依赖于主流分布式执行框架采用的两种主要执行模型:批量同步处理(BSP)与逐记录处理(RAT)。相应地,我们在Apache Spark Streaming(BSP模型)和Apache Flink(RAT模型)之上实现BigSR。为得出BSP与RAT对E&S的影响结论,我们分析两种模型支持分布式流推理的能力,并识别出若干按其支持程度表征的用例类型。该分类通过评估每类用例相对于其表达性水平的可扩展性,得以量化E&S权衡。随后,我们使用来自4个不同数据集的15个查询开展一系列实验。实验表明,基于BSP与RAT的BigSR通常可扩展至每秒百万三元组以上的高吞吐(无论是否含递归),且RAT在无状态查询算子下达到亚毫秒级延迟。

关键词

引用

@article{arxiv.1804.04367,
  title  = {BigSR: an empirical study of real-time expressive RDF stream reasoning on modern Big Data platforms},
  author = {Xiangnan Ren and Olivier Curé and Hubert Naacke and Guohui Xiao},
  journal= {arXiv preprint arXiv:1804.04367},
  year   = {2018}
}

备注

16 pages, 8 figures