最优分位数估计:超越比较模型
数据结构与算法
2024-04-08 v1
摘要
分位数估计是数据草图的基本问题之一。给定来自大小为 的某个宇宙的 个元素 以数据流形式到达,分位数草图估计任何元素的秩,加性误差最多为 。解决该问题的低空间算法在数据库系统、网络测量、负载均衡和许多其他实际场景中有应用。当前被描述为最优的分位数估计算法包括使用 个字的 GK 草图(Greenwald 和 Khanna 2001)(确定性)和使用 个字的 KLL 草图(Karnin, Lang 和 Liberty 2016)(随机,失败概率 )。然而,这两种算法仅在基于比较的模型中最优,而大多数典型应用涉及整数流,草图除了进行比较外还可以利用这些整数。如果我们超越基于比较的模型,确定性的 q-digest 草图(Shrivastava, Buragohain, Agrawal 和 Suri 2004)实现了 个字的空间复杂度,这与之前提到的草图不可比较。长期以来,人们一直问是否存在使用 个字空间的分位数草图(只要 ,这是最优的)。在这项工作中,我们提出了一种使用 个字的确定性算法,解决了这一系列工作。
引用
@article{arxiv.2404.03847,
title = {Optimal quantile estimation: beyond the comparison model},
author = {Meghal Gupta and Mihir Singhal and Hongxun Wu},
journal= {arXiv preprint arXiv:2404.03847},
year = {2024}
}