中文

Count-Sketch 的改进浓度界

数据结构与算法 2013-10-22 v3

摘要

我们对经典的 Count-Sketch 流式重 hitters 算法 [CCF02] 进行了精细化分析。Count-Sketch 使用 O(klogn)O(k \log n) 个对 Rn\mathbb{R}^n 中向量 xx 的线性测量来给出 xx 的估计 xx'。标准分析表明,该估计 xx' 满足 xx2<xtail22/k||x'-x||_\infty^2 < ||x_{tail}||_2^2 / k,其中 xtailx_{tail} 是包含 xx 中除最大 kk 个坐标外所有坐标的向量。我们的主要结果是,xx' 的大部分坐标的误差远小于该上界;具体而言,对于任意 c<O(logn)c < O(\log n),只要哈希函数是完全独立的,我们就证明每个坐标 ii12Ω(c)1-2^{-\Omega(c)} 的概率满足 (xixi)2<(c/logn)xtail22/k(x'_i - x_i)^2 < (c/\log n) ||x_{tail}||_2^2/k。这一结果涵盖了之前的界限,并且对所有 cc 都是最优的。利用这些改进的点估计,我们首先分析协方差矩阵,然后利用“中位数的中位数的中位数”论证来引导失败概率界限,从而证明了集合估计的更强浓度结果。当 xx drawn 自具有适当衰减(如幂律或对数正态)的分布时,这些结果也为精确 kk-稀疏估计 xx^*l2l_2 恢复提供了改进结果。我们通过幂律分布上的 Count-Sketch 模拟补充了我们的结果。经验证据表明,我们的理论界限精确刻画了算法的性能:渐近行为正确且相关常数很小。我们的证明表明,任何具有有限方差和正傅里叶变换的对称随机变量围绕 0 的集中程度至少与高斯分布一样好。这一结果可能具有独立兴趣,即使在噪声不收敛于高斯分布的情况下也能提供良好的集中性。

关键词

引用

@article{arxiv.1207.5200,
  title  = {Improved Concentration Bounds for Count-Sketch},
  author = {Gregory T. Minton and Eric Price},
  journal= {arXiv preprint arXiv:1207.5200},
  year   = {2013}
}

备注

25 pages SODA 2014