基数估计的信息论极限:Fisher 与 Shannon 相遇
数据结构与算法
2026-02-17 v3 信息论
math.IT
摘要
估计大型多重集的基数(不同元素的数量)是流处理与草图算法中的经典问题。本文研究草图的空间复杂度与其估计误差之间的内在权衡。我们为数据草图定义了一种称为 Fisher-Shannon(FiSh)数 的新效率度量。它刻画了草图的极限 Shannon 熵()与其归一化 Fisher 信息(,表征统计高效、渐近无偏估计量的方差)之间的张力。我们引入 FiSh 数的目的在于构建必要的数学工具,以论证精确到常数倍(而非渐近意义)的最优性。我们的结果如下。[1] 我们证明 Flajolet 与 Martin 的 PCSA 草图的所有基- 变体的 FiSh 数为 ,且 HyperLogLog 的每个基- 变体的 FiSh 数均劣于 ,但当 时它们趋于 。此处 为精确定义的常数。[2] 我们描述了一种称为 Fishmonger 的草图,它基于 PCSA 的平滑、熵压缩变体并采用不同的估计函数。Fishmonger 处理 的多重集,使得在所有时刻,以高概率其空间为 比特,其标准误差为 。例如,要达到 1% 的标准误差,需要略多于 19,800 比特,即 千字节。[3] 最后,我们给出间接证据,表明 是可合并草图用于基数估计的最优 FiSh 数。我们定义了一类称为可线性化草图的自然可合并草图子集,并证明该类中没有任何成员能优于 。事实上,流行的可合并草图也是可线性化的。
引用
@article{arxiv.2007.08051,
title = {Information Theoretic Limits of Cardinality Estimation: Fisher Meets Shannon},
author = {Seth Pettie and Dingyu Wang},
journal= {arXiv preprint arXiv:2007.08051},
year = {2026}
}