中文

最优分位数估计:超越比较模型

数据结构与算法 2024-04-08 v1

摘要

分位数估计是数据草图的基本问题之一。给定来自大小为 UU 的某个宇宙的 nn 个元素 x1,x2,,xnx_1, x_2, \dots, x_n 以数据流形式到达,分位数草图估计任何元素的秩,加性误差最多为 εn\varepsilon n。解决该问题的低空间算法在数据库系统、网络测量、负载均衡和许多其他实际场景中有应用。当前被描述为最优的分位数估计算法包括使用 O(ε1logn)O(\varepsilon^{-1} \log n) 个字的 GK 草图(Greenwald 和 Khanna 2001)(确定性)和使用 O(ε1loglog(1/δ))O(\varepsilon^{-1} \log\log(1/\delta)) 个字的 KLL 草图(Karnin, Lang 和 Liberty 2016)(随机,失败概率 δ\delta)。然而,这两种算法仅在基于比较的模型中最优,而大多数典型应用涉及整数流,草图除了进行比较外还可以利用这些整数。如果我们超越基于比较的模型,确定性的 q-digest 草图(Shrivastava, Buragohain, Agrawal 和 Suri 2004)实现了 O(ε1logU)O(\varepsilon^{-1}\log U) 个字的空间复杂度,这与之前提到的草图不可比较。长期以来,人们一直问是否存在使用 O(ε1)O(\varepsilon^{-1}) 个字空间的分位数草图(只要 npoly(U)n \leq \mathrm{poly}(U),这是最优的)。在这项工作中,我们提出了一种使用 O(ε1)O(\varepsilon^{-1}) 个字的确定性算法,解决了这一系列工作。

关键词

引用

@article{arxiv.2404.03847,
  title  = {Optimal quantile estimation: beyond the comparison model},
  author = {Meghal Gupta and Mihir Singhal and Hongxun Wu},
  journal= {arXiv preprint arXiv:2404.03847},
  year   = {2024}
}