Count-Sketch 的改进浓度界
数据结构与算法
2013-10-22 v3
摘要
我们对经典的 Count-Sketch 流式重 hitters 算法 [CCF02] 进行了精细化分析。Count-Sketch 使用 个对 中向量 的线性测量来给出 的估计 。标准分析表明,该估计 满足 ,其中 是包含 中除最大 个坐标外所有坐标的向量。我们的主要结果是, 的大部分坐标的误差远小于该上界;具体而言,对于任意 ,只要哈希函数是完全独立的,我们就证明每个坐标 以 的概率满足 。这一结果涵盖了之前的界限,并且对所有 都是最优的。利用这些改进的点估计,我们首先分析协方差矩阵,然后利用“中位数的中位数的中位数”论证来引导失败概率界限,从而证明了集合估计的更强浓度结果。当 drawn 自具有适当衰减(如幂律或对数正态)的分布时,这些结果也为精确 -稀疏估计 的 恢复提供了改进结果。我们通过幂律分布上的 Count-Sketch 模拟补充了我们的结果。经验证据表明,我们的理论界限精确刻画了算法的性能:渐近行为正确且相关常数很小。我们的证明表明,任何具有有限方差和正傅里叶变换的对称随机变量围绕 0 的集中程度至少与高斯分布一样好。这一结果可能具有独立兴趣,即使在噪声不收敛于高斯分布的情况下也能提供良好的集中性。
引用
@article{arxiv.1207.5200,
title = {Improved Concentration Bounds for Count-Sketch},
author = {Gregory T. Minton and Eric Price},
journal= {arXiv preprint arXiv:1207.5200},
year = {2013}
}
备注
25 pages SODA 2014