中文

基数估计的信息论极限:Fisher 与 Shannon 相遇

数据结构与算法 2026-02-17 v3 信息论 math.IT

摘要

估计大型多重集的基数(不同元素的数量)是流处理与草图算法中的经典问题。本文研究草图的空间复杂度与其估计误差之间的内在权衡。我们为数据草图定义了一种称为 Fisher-Shannon(FiSh)数 H/I\mathcal{H}/\mathcal{I} 的新效率度量。它刻画了草图的极限 Shannon 熵(H\mathcal{H})与其归一化 Fisher 信息(I\mathcal{I},表征统计高效、渐近无偏估计量的方差)之间的张力。我们引入 FiSh 数的目的在于构建必要的数学工具,以论证精确到常数倍(而非渐近意义)的最优性。我们的结果如下。[1] 我们证明 Flajolet 与 Martin 的 PCSA 草图的所有基-qq 变体的 FiSh 数为 H0/I01.98016H_0/I_0 \approx 1.98016,且 HyperLogLog 的每个基-qq 变体的 FiSh 数均劣于 H0/I0H_0/I_0,但当 qq\rightarrow \infty 时它们趋于 H0/I0H_0/I_0。此处 H0,I0H_0,I_0 为精确定义的常数。[2] 我们描述了一种称为 Fishmonger 的草图,它基于 PCSA 的平滑、熵压缩变体并采用不同的估计函数。Fishmonger 处理 [U][U] 的多重集,使得在所有时刻,以高概率其空间为 (1+o(1))(H0/I0)m1.98m(1+o(1))(H_0/I_0)m \approx 1.98m 比特,其标准误差为 1/m1/\sqrt{m}。例如,要达到 1% 的标准误差,需要略多于 19,800 比特,即 2.42\approx 2.42 千字节。[3] 最后,我们给出间接证据,表明 H0/I0H_0/I_0 是可合并草图用于基数估计的最优 FiSh 数。我们定义了一类称为可线性化草图的自然可合并草图子集,并证明该类中没有任何成员能优于 H0/I0H_0/I_0。事实上,流行的可合并草图也是可线性化的。

关键词

引用

@article{arxiv.2007.08051,
  title  = {Information Theoretic Limits of Cardinality Estimation: Fisher Meets Shannon},
  author = {Seth Pettie and Dingyu Wang},
  journal= {arXiv preprint arXiv:2007.08051},
  year   = {2026}
}