PRESTO:基于子图重叠的 RDF 查询概率基数估计
数据库
2018-01-22 v1
摘要
在查询优化中,准确的基数估计对于寻找最优查询计划至关重要。由于缺少显式模式以及 RDF 查询中连接操作过度频繁,这对 RDF 尤为具有挑战性。现有方法通常基于三元组计数收集统计信息,并将查询的基数估计为其连接分量的乘积,即便各分量估计准确,误差也会累积。与现有方法不同,我们提出 PRESTO,一种基于子图计数而非三元组计数、并采用概率方法将 RDF 查询基数作为整体进行估计的方法。PRESTO 避免了现有方法的一些主要问题,并能在有界内存约束下准确估计任意查询。我们使用 YAGO 对 PRESTO 进行评估,表明 PRESTO 对于简单与复杂查询均更为准确。
引用
@article{arxiv.1801.06408,
title = {PRESTO: Probabilistic Cardinality Estimation for RDF Queries Based on Subgraph Overlapping},
author = {Xin Wang and Eugene Siow and Aastha Madaan and Thanassis Tiropanis},
journal= {arXiv preprint arXiv:1801.06408},
year = {2018}
}