中文

数据流中空间最优的轮廓估计及其在对称函数上的应用

数据结构与算法 2023-11-30 v1

摘要

我们重新审视在数据流模型中估计轮廓(亦称稀有度)的问题。给定来自大小为 nn 的论域的 mm 个元素序列,其轮廓是一个向量 ϕ\phi,其中第 ii 个分量 ϕi\phi_i 表示在流中恰好出现 ii 次的不同元素的数量。Datar 与 Muthukrishan 在 2002 年的一篇经典论文给出了一种算法,使用 O(1/ϵ2(logn+logm))O(1/\epsilon^2 (\log n + \log m)) 比特的空间,将任意分量 ϕi\phi_i 估计到 ±ϵD\pm \epsilon D 的加性误差范围内,其中 DD 是流中不同元素的数量。在本文中,我们大幅改进了这一结果,设计了一种算法,可同时以较小的整体误差估计轮廓向量 ϕ\phi 的多个坐标。我们给出的算法以常概率产生估计轮廓 ϕ^\hat\phi,并在空间与估计误差方面具有以下保证:— 对于任意常数 τ\tau,使用 O(1/ϵ2+logn)O(1 / \epsilon^2 + \log n) 比特空间,i=1τϕiϕ^iϵD\sum_{i=1}^\tau |\phi_i - \hat\phi_i| \leq \epsilon D。— 使用 O(1/ϵ2log(1/ϵ)+logn+loglogm)O(1/ \epsilon^2\log (1/\epsilon) + \log n + \log \log m) 比特空间,i=1mϕiϕ^iϵm\sum_{i=1}^m |\phi_i - \hat\phi_i| \leq \epsilon m。除了对多个坐标的误差进行界定外,我们的空间界将依赖于 1/ϵ1/\epsilon 的项与依赖于 nnmm 的项分离开来。我们证明了两种情形下空间的下界匹配。我们的轮廓估计算法的应用可在 O(1/ϵ2+logn)O(1/\epsilon^2 + \log n) 比特内给出频率的若干对称函数误差在 ±ϵD\pm \epsilon D 内的估计。这将不同元素问题的空间最优算法推广到其他问题,包括估计 Huber 与 Tukey 损失以及频率上限统计。

关键词

引用

@article{arxiv.2311.17868,
  title  = {Space-Optimal Profile Estimation in Data Streams with Applications to Symmetric Functions},
  author = {Justin Y. Chen and Piotr Indyk and David P. Woodruff},
  journal= {arXiv preprint arXiv:2311.17868},
  year   = {2023}
}

备注

To appear in ITCS 2024