中文

利用被丢弃样本更紧致地估计多集合聚合值

数据库 2009-03-05 v1 信息检索

摘要

许多数据集,例如市场购物篮数据、文本或超文本文档,以及在不同地点或时间段记录的传感器观测数据,都被建模为基于基本键集合的集合集合。我们感兴趣的是满足基于键属性及其在特定集合中成员资格定义的某些选择谓词的键的基本聚合值,例如权重或选择率。这种通用公式包含了诸如 Jaccard 系数、汉明距离和关联规则等基本聚合值。在海量数据集上,精确计算可能效率低下或不可行。基于协调随机样本的草图是支持近似查询处理的经典摘要。查询的解析过程为:从这些集合的草图中生成谓词中所用集合的并集的草图(样本),然后将估计器应用于该并集草图。我们推导出了更紧致的无偏估计器,它们利用了存在于适用草图并集中但被排除在并集草图之外的被采样键。我们从解析上证明,对于所有查询和数据集,我们的估计器优于应用于并集草图的估计器。在合成数据和真实数据上的经验评估表明,在典型应用中,我们可以预期估计误差减少 25% 到 4 倍。

关键词

引用

@article{arxiv.0903.0625,
  title  = {Leveraging Discarded Samples for Tighter Estimation of Multiple-Set Aggregates},
  author = {Edith Cohen and Haim Kaplan},
  journal= {arXiv preprint arXiv:0903.0625},
  year   = {2009}
}

备注

16 pages