中文

带理论保证的分区学习型布隆过滤器快速构建方法

数据结构与算法 2024-10-18 v1

摘要

布隆过滤器是用于近似成员查询的广泛应用经典数据结构。学习型布隆过滤器通过利用机器学习提升内存效率,其中分区学习型布隆过滤器(PLBF)是最具内存效率的变体之一。然而,PLBF 在构建过程中的计算复杂度较高,具体为 O(N3k)O(N^3k),其中 NNkk 为超参数。本文提出了三种方法:快速 PLBF、快速 PLBF++ 和快速 PLBF#,将构建复杂度分别降低至 O(N2k)O(N^2k)O(NklogN)O(Nk \log N)O(Nklogk)O(Nk \log k)。快速 PLBF 保留原始 PLBF 的结构和内存效率。虽然快速 PLBF++ 和快速 PLBF# 可能具有不同的结构,但我们在理想数据分布下对其进行了理论证明,证明其等价于 PLBF。此外,我们对 PLBF 与快速 PLBF++ 在非理想情形下的内存效率差异进行了理论上界限分析。实验在真实数据集上表明,快速 PLBF、快速 PLBF++ 和快速 PLBF# 分别比原始 PLBF 快 up to 233、761 和 778 倍。此外,快速 PLBF 保持与 PLBF 相同的数据结构,快速 PLBF++ 和快速 PLBF# 实现了接近相同的内存效率。

关键词

引用

@article{arxiv.2410.13278,
  title  = {Fast Construction of Partitioned Learned Bloom Filter with Theoretical Guarantees},
  author = {Atsuki Sato and Yusuke Matsui},
  journal= {arXiv preprint arXiv:2410.13278},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2306.02846