中文

插入流中击败CountSketch的频繁项查找

数据结构与算法 2015-11-03 v1

摘要

给定来自全域U\mathcal{U}的项流p1,,pmp_1, \ldots, p_m,不失一般性我们将其与整数集{1,2,,n}\{1, 2, \ldots, n\}等同,我们考虑返回所有2\ell_2-频繁项的问题,即那些满足fjϵF2f_j \geq \epsilon \sqrt{F_2}的项jj,其中fjf_j是项jj在流中出现的次数,且F2=i[n]fi2F_2 = \sum_{i \in [n]} f_i^2。此种保证远比1\ell_1-保证更强,后者找出满足fjϵmf_j \geq \epsilon mjj。2002年,Charikar、Chen和Farach-Colton提出了{\sf CountSketch}数据结构,其使用Θ(log2n)\Theta(\log^2 n)比特空间(对于常数ϵ>0\epsilon > 0)找出所有此类jj。唯一已知的下界是Ω(logn)\Omega(\log n)比特空间,这来自于需要指定所找到项的标识。在本文中,我们展示对于此问题有可能达到O(lognloglogn)O(\log n \log \log n)比特空间。我们基于高斯过程的技术导致了数据流的一系列其他新结果,包括(1)首个在流中所有点同时估计F2F_2的算法,仅使用O(lognloglogn)O(\log n\log\log n)比特空间,改进了自然的并集界以及Huang、Tai和Yi(2014)的算法。(2)一种以O(lognloglogn)O(\log n\log\log n)比特空间将流的\ell_{\infty}范数估计至加性误差ϵF2\epsilon \sqrt{F_2}的方法,解决了IITK 2006列表中关于仅插入流的开放问题3。

关键词

引用

@article{arxiv.1511.00661,
  title  = {Beating CountSketch for Heavy Hitters in Insertion Streams},
  author = {Vladimir Braverman and Stephen R. Chestnut and Nikita Ivkin and David P. Woodruff},
  journal= {arXiv preprint arXiv:1511.00661},
  year   = {2015}
}