插入流中击败CountSketch的频繁项查找
数据结构与算法
2015-11-03 v1
摘要
给定来自全域的项流,不失一般性我们将其与整数集等同,我们考虑返回所有-频繁项的问题,即那些满足的项,其中是项在流中出现的次数,且。此种保证远比-保证更强,后者找出满足的。2002年,Charikar、Chen和Farach-Colton提出了{\sf CountSketch}数据结构,其使用比特空间(对于常数)找出所有此类。唯一已知的下界是比特空间,这来自于需要指定所找到项的标识。在本文中,我们展示对于此问题有可能达到比特空间。我们基于高斯过程的技术导致了数据流的一系列其他新结果,包括(1)首个在流中所有点同时估计的算法,仅使用比特空间,改进了自然的并集界以及Huang、Tai和Yi(2014)的算法。(2)一种以比特空间将流的范数估计至加性误差的方法,解决了IITK 2006列表中关于仅插入流的开放问题3。
引用
@article{arxiv.1511.00661,
title = {Beating CountSketch for Heavy Hitters in Insertion Streams},
author = {Vladimir Braverman and Stephen R. Chestnut and Nikita Ivkin and David P. Woodruff},
journal= {arXiv preprint arXiv:1511.00661},
year = {2015}
}