中文

具有分布敏感区间保证的快速近似聚合

数据库 2020-08-11 v1

摘要

数据聚合是数据分析、数据探索和 OLAP 的基础。近似查询处理 (AQP) 技术常用于利用样本加速聚合计算,其中置信区间 (CIs) 被广泛用于量化相关误差。实践中使用的置信区间分为两类:一类是紧致但不正确,即它们给出紧致区间但仅提供渐近保证,使其不可靠;另一类是正确的但不紧致,即它们提供严格保证,但过于保守,导致置信区间过宽而无用。在本文中,我们开发了一种既正确又比传统方法更紧致的置信区间技术。从保守置信区间出发,我们识别出它们经常面临的两个问题:悲观质量分配 (PMA) 和幻影离群值敏感性 (PHOS)。通过开发一种用于消除 PHOS 的新型区间裁剪技术,并将其与无 PMA 的已知置信区间技术配对,我们开发了一种计算具有强保证的置信区间的技术,其在相同宽度下需要更少的样本。我们在采样优化的内存列存储之下实现了我们的技术,并展示了如何加速涉及聚合的查询,在真实数据集上相对于传统带保证的 AQP 实现了高达 124 倍的加速,相对于精确方法实现了超过 1000 倍的加速。

关键词

引用

@article{arxiv.2008.03891,
  title  = {Rapid Approximate Aggregation with Distribution-Sensitive Interval Guarantees},
  author = {Stephen Macke and Maryam Aliakbarpour and Ilias Diakonikolas and Aditya Parameswaran and Ronitt Rubinfeld},
  journal= {arXiv preprint arXiv:2008.03891},
  year   = {2020}
}