中文

技术报告:回收布隆过滤器平均假阳性率建模

数据结构与算法 2024-02-06 v2

摘要

布隆过滤器是一种空间高效的数据结构,用于测试集合成员资格,仅在假阳性方向上出错。然而,衡量这种假阳性率的标准分析提供了一种最坏情况下的界限,对于大多数使用布隆过滤器的网络应用来说,这种界限过于保守,并且由于没有考虑每次到达后布隆过滤器的实际状态(设置的位数),降低了准确性。在本文中,我们更准确地描述了布隆过滤器在网络应用中常见使用时的假阳性动态特性。特别是,网络应用通常使用一种“回收”的布隆过滤器:它反复填充,并在达到一定饱和水平后清空并再次填充。在这种情况下,使用平均假阳性率而不是最坏情况界限来评估性能更有意义。我们展示了如何通过更新模型和马尔可夫模型高效计算回收布隆过滤器变体的平均假阳性率。我们将模型应用于标准布隆过滤器和一种“两阶段”变体,通过仿真验证了模型的准确性,并发现先前分析的最坏情况公式导致布隆过滤器在网络应用中的效率降低高达30%,而两阶段开销随着所需假阳性率的收紧而减小。

关键词

引用

@article{arxiv.2401.02647,
  title  = {Technical Report: Modeling Average False Positive Rates of Recycling Bloom Filters},
  author = {Kahlil Dozier and Loqman Salamatian and Dan Rubenstein},
  journal= {arXiv preprint arXiv:2401.02647},
  year   = {2024}
}