中文

利用拾取 - 丢弃采样逼近大频率矩

数据结构与算法 2012-12-05 v2

摘要

给定大小为 mm 的数据流 D={p1,p2,...,pm}D = \{p_1,p_2,...,p_m\},其元素取自 {1,...,n}\{1,..., n\},定义 ii 的频率为 fi={j:pj=i}f_i = |\{j: p_j = i\}|DD 的第 kk 个\emph{频率矩}定义为 Fk=i=1nfikF_k = \sum_{i=1}^n f_i^k。我们考虑在仅插入流中逼近 k3k\ge 3 的频率矩问题。对于任意常数 cc,我们证明了该问题空间复杂度的上界为 O(n12/klog(n)log(c)(n))O(n^{1-2/k}\log(n)\log^{(c)}(n))。此处 log(c)(n)\log^{(c)}(n) 为迭代 log\log 函数。为简化表述,我们作如下假设:nnmm 多项式级分离;近似误差 ϵ\epsilon 和参数 kk 为常数。我们观察到流与特殊矩阵之间存在自然双射。我们的主要技术贡献是一种针对矩阵的非均匀采样方法。我们将此方法称为\emph{拾取 - 丢弃采样};它以 Ω(1/n12/k)\Omega(1/n^{1-2/k}) 的概率采样重元素(即频率为 Ω(Fk)\Omega(F_k) 的元素 ii),并给出近似值 fi~(1ϵ)fi\tilde{f_i} \ge (1-\epsilon)f_i。此外,估计值从不超出真实值,即对所有 jjfj~fj \tilde{f_j} \le f_j。因此,我们将寻找重元素的空间复杂度降低至 O(n12/klog(n))O(n^{1-2/k}\log(n)) 比特。我们应用递归草图方法,以 O(n12/klog(n)log(c)(n))O(n^{1-2/k}\log(n)\log^{(c)}(n)) 比特解决了该问题。

关键词

引用

@article{arxiv.1212.0202,
  title  = {Approximating Large Frequency Moments with Pick-and-Drop Sampling},
  author = {Vladimir Braverman and Rafail Ostrovsky},
  journal= {arXiv preprint arXiv:1212.0202},
  year   = {2012}
}