中文

布隆过滤器的流内概率基数估计

数据结构与算法 2022-11-02 v2

摘要

过去几年中,来自物联网传感器、社交网络、蜂窝网络等不同来源的数据量呈指数增长。概率数据结构(PDS)是适用于大数据处理与流应用的确定性数据结构的高效替代方案。它们主要用于近似成员查询、频率计数、基数估计与相似性研究。在大型数据集或流数据中查找不同元素的数量是活跃的研究领域。本文中,我们表明基于布隆过滤器的此类基数估计的常用方法平均上相对准确但方差较大。因此,降低该方差对于获得准确统计量颇有价值。我们提出一种概率方法,基于布隆过滤器的参数更准确地估计其基数,即哈希函数个数 kk、大小 mm,以及计数器 ss(每当某元素不在过滤器中时递增,即该元素的成员查询结果否定时)。由于布隆过滤器的性质,计数器的值不可能大于精确基数,但哈希冲突可能导致其低估基数。这产生了一种计数误差,我们对其及标准差进行了流内准确估计。我们还讨论了基于计数误差优化布隆过滤器参数的方法。我们使用由移动网络运营商提供的真实移动数据集(以手机记录计算的位移矩阵形式)分析所生成的合成数据评估了我们的方法。本文提出的方法平均上至少表现相当,且方差远小于最先进方法(约低 6 至 7 倍)。

关键词

引用

@article{arxiv.2210.15630,
  title  = {In-stream Probabilistic Cardinality Estimation for Bloom Filters},
  author = {Remy Scholler and Jean-Francois Couchot and Oumaima Alaoui-Ismaili and Denis Renaud and Eric Ballot},
  journal= {arXiv preprint arXiv:2210.15630},
  year   = {2022}
}

备注

18 pages, 10 figures, 3 tables