基于高级布隆过滤器的流数据高效近似去重算法
信息检索
2012-12-18 v1
摘要
涉及电信通话详单、网页、在线交易、医疗记录、股票市场、气候预警系统等应用,需要对来自不同来源的海量指数级数据进行高效管理和处理。在流式场景中,对无界数据流进行近似重复识别与消除的去重或智能压缩,由于数据到达的实时性而面临更大挑战。稳定布隆过滤器(Stable Bloom Filters, SBF)在一定程度上解决了这一问题。本文中,我们提出了几种用于数据流近似重复检测的新算法。我们提出了结合蓄水池抽样与布隆过滤器工作原理的基于蓄水池抽样的布隆过滤器(Reservoir Sampling based Bloom Filter, RSBF)。我们还提出了基于有偏抽样概念的多种新型有偏抽样布隆过滤器(Biased Sampling based Bloom Filter, BSBF)变体。我们还提出了一种随机负载均衡的抽样布隆过滤器方法变体,以高效处理重复检测问题。因此,本文提供了一个使用布隆过滤器进行去重的通用框架。通过详细的理论分析,我们证明了所提出结构的假阳性率、假阴性率和收敛速度的解析界限。我们展示了我们的模型明显优于现有方法。我们还使用真实世界数据集(300万条记录)以及捕获各种输入分布的合成数据集(10亿条记录)对这些结构进行了实证分析。
引用
@article{arxiv.1212.3964,
title = {Advanced Bloom Filter Based Algorithms for Efficient Approximate Data De-Duplication in Streams},
author = {Suman K. Bera and Sourav Dutta and Ankur Narang and Souvik Bhattacherjee},
journal= {arXiv preprint arXiv:1212.3964},
year = {2012}
}
备注
41 pages