中文

用于从小样本准确估计集合表达式基数的 MTS 草图

数据库 2016-11-08 v1 数据结构与算法

摘要

基于草图(sketch)的流算法能够高效处理大数据。这些算法使用小的固定大小存储来保存输入数据的摘要(“草图”),并利用概率算法估计所需数量。然而,在许多实际应用中,收集和处理整个数据流是不切实际的,因此通常的做法是仅对其一小部分进行采样和处理。虽然采样对于处理海量数据集至关重要,但可能会降低准确性。在本文中,我们提出了一个新框架,仅使用每个流的少量样本,即可准确估计任意数量流之间任何集合表达式的基数。所提出的框架由一种称为最大项与子采样(Maximal-Term with Subsample, MTS)的新草图以及使用该草图的一系列算法组成。可以利用所提草图高效回答的一个可能查询示例是:在表 T1T_1T2T_2 中出现但不在 T3T_3 中的不同元组有多少个?本文提出的算法能够准确回答此类查询,仅处理每个表中元组的小样本并使用恒定数量的内存。此类估计对于超大型数据库系统上的查询优化很有用。我们证明了所有算法都是无偏的,并分析了它们的渐近方差。

关键词

引用

@article{arxiv.1611.01853,
  title  = {MTS Sketch for Accurate Estimation of Set-Expression Cardinalities from Small Samples},
  author = {Reuven Cohen and Liran Katzir and Aviv Yehezkel},
  journal= {arXiv preprint arXiv:1611.01853},
  year   = {2016}
}

备注

arXiv admin note: text overlap with arXiv:1508.06216