中文

识别二维数据流中的相关重 hitter

数据库 2013-10-07 v1

摘要

我们考虑从数据流中在线挖掘相关的重 hitter(heavy-hitters)。给定一个二维数据流,相关聚合查询首先通过沿主维度应用谓词提取子流,然后沿次维度计算聚合值。先前关于识别流中重 hitter 的工作几乎完全集中在识别单维流中的重 hitter,而这些工作对于沿其他维度的重 hitter 属性提供的见解甚少。然而在典型应用中,分析人员不仅感兴趣于识别重 hitter,还希望理解进一步的属性,例如:哪些其他项与重 hitter 频繁一起出现,或者与重 hitter 一起出现的项的频率分布是什么。我们考虑如下形式的查询:在由 (x, y) 元组组成的流 S 中,针对所有为重 hitter 的 x 值构成的子流 H,维护那些在 H 中与 x 值频繁出现的 y 值。我们将此问题称为相关重 hitter(Correlated Heavy-Hitters, CHH)。我们制定了 CHH 识别的近似公式,并提出了一种在数据流上跟踪 CHH 的算法。该算法易于实现,且使用的空间比流本身小几个数量级。我们提供了关于最大误差的可证明保证,以及展示空间 - 精度权衡的详细实验结果。

关键词

引用

@article{arxiv.1310.1161,
  title  = {Identifying Correlated Heavy-Hitters in a Two-Dimensional Data Stream},
  author = {Bibudh Lahiri and Arko Provo Mukherjee and Srikanta Tirthapura},
  journal= {arXiv preprint arXiv:1310.1161},
  year   = {2013}
}