数据流中频繁项发现的新算法
数据结构与算法
2016-03-08 v1
摘要
数据库和数据流中一个古老而基本的问题是寻找频繁项(heavy hitters),也称为 top-、最流行项、频繁项、大象或冰山查询。该问题有几种变体,它们量化了项频繁的含义,包括所谓的 -频繁项和 -频繁项。针对这些问题,已有多种算法解决方案,始于 Misra 和 Gries 的工作,以及 CountMin 和 CountSketch 数据结构等。在这篇伴随 ICDT 特邀报告的综述文章中,我们涵盖了该领域近期发展的一些成果,这些成果改进了这些问题的经典解决方案。特别是,我们与合著者共同开发了用于寻找 -频繁项和 -频繁项的新算法,其所需内存显著少于已知算法,并且在多个参数范围内是最优的。
引用
@article{arxiv.1603.01733,
title = {New Algorithms for Heavy Hitters in Data Streams},
author = {David P. Woodruff},
journal= {arXiv preprint arXiv:1603.01733},
year = {2016}
}
备注
A preliminary version of this paper will appear as an invited paper in ICDT, 2016