中文

面向分组聚合查询的随机采样

数据库 2019-09-13 v3 数据结构与算法

摘要

随机采样因其在显著降低资源使用和响应时间的同时仅带来微小近似误差的潜力,已被广泛应用于大型数据库上的近似查询处理。我们考虑使用随机采样来回答普遍存在的分组聚合查询,这类查询首先根据一个或多个属性对数据进行分组,然后在通过谓词过滤后,在每个组内进行聚合。分组聚合查询的挑战在于,采样方法不能专注于优化单个答案(例如所选数据的均值)的质量,而必须同时优化一组答案(每组一个)的质量。我们提出了CVOPT,一个面向一组分组聚合查询的、由查询和数据驱动的采样框架。为了评估样本的质量,CVOPT基于不同答案的变异系数(CV)的范数(例如2\ell_2\ell_\infty)定义了一个度量,并构建了一个可证明优化该度量的分层样本。CVOPT能够处理数据中各组具有截然不同统计特性(如频率、均值或方差)的分组聚合查询。CVOPT可联合优化多个聚合和多个分组依据子句,并提供了一种优先考虑特定组或聚合的方法。它可以针对部分查询工作负载信息已知的情况进行调整,例如在定期调度查询的数据仓库中。我们的实验结果表明,对于分组聚合查询,CVOPT在样本质量和估计精度上均优于当前最先进的技术。在两个真实世界数据集上的一组查询中,在相同的空间预算下,CVOPT产生的相对误差比竞争方法小5倍。

关键词

引用

@article{arxiv.1909.02629,
  title  = {Random Sampling for Group-By Queries},
  author = {Trong Duc Nguyen and Ming-Hung Shih and Sai Sree Parvathaneni and Bojian Xu and Divesh Srivastava and Srikanta Tirthapura},
  journal= {arXiv preprint arXiv:1909.02629},
  year   = {2019}
}