中文

数据流中频繁项发现的新算法

数据结构与算法 2016-03-08 v1

摘要

数据库和数据流中一个古老而基本的问题是寻找频繁项(heavy hitters),也称为 top-kk、最流行项、频繁项、大象或冰山查询。该问题有几种变体,它们量化了项频繁的含义,包括所谓的 1\ell_1-频繁项和 2\ell_2-频繁项。针对这些问题,已有多种算法解决方案,始于 Misra 和 Gries 的工作,以及 CountMin 和 CountSketch 数据结构等。在这篇伴随 ICDT 特邀报告的综述文章中,我们涵盖了该领域近期发展的一些成果,这些成果改进了这些问题的经典解决方案。特别是,我们与合著者共同开发了用于寻找 1\ell_1-频繁项和 2\ell_2-频繁项的新算法,其所需内存显著少于已知算法,并且在多个参数范围内是最优的。

关键词

引用

@article{arxiv.1603.01733,
  title  = {New Algorithms for Heavy Hitters in Data Streams},
  author = {David P. Woodruff},
  journal= {arXiv preprint arXiv:1603.01733},
  year   = {2016}
}

备注

A preliminary version of this paper will appear as an invited paper in ICDT, 2016