RDF 图中有趣聚集的高效探索
数据库
2021-04-01 v1
摘要
随着如今大型开放数据日益以 RDF 图形式共享,帮助用户发现图中最有趣的方面(若无自动工具往往难以把握)的需求不断增长。我们考虑在给定整数 k 和用户指定的趣味性函数下,自动识别可在 RDF 图上评估的 k 个最有趣聚集查询的问题。我们的问题不同于关系型数据仓库中的分析之处在于:(i) 在 RDF 图中,我们并非给定而是必须识别候选聚集的事实、维度和度量;(ii) 在面对 RDF 数据中的多值维度时,高效评估多个聚集的经典方法失效。在本工作中,我们提出一个可扩展的端到端框架,其基于一种新的 RDF 兼容一遍算法(用于高效评估聚集格)和一种新颖的早停技术(具有概率保证,可剪枝无趣聚集)来实现有趣聚集的识别与评估。使用真实与合成图的实验证明了我们的框架在大型搜索空间中寻找有趣聚集的能力、我们算法的高效性(相较基于现有算法的类似流水线最高加速 2.9 倍)以及随数据规模与复杂度增长的扩展性。
引用
@article{arxiv.2103.17178,
title = {Efficient Exploration of Interesting Aggregates in RDF Graphs},
author = {Yanlei Diao and Paweł Guzewicz and Ioana Manolescu and Mirjana Mazuran},
journal= {arXiv preprint arXiv:2103.17178},
year = {2021}
}
备注
Accepted for publication in proceedings of the 2021 International Conference on Management of Data (SIGMOD '21), June 20--25, 2021, Virtual Event, China