无重复:基于高度集中哈希的快速流处理
数据结构与算法
2020-04-03 v1
摘要
为获得以高概率落在某误差界内的估计量,一种常见策略是设计一个以常数概率工作的估计量,然后通过独立重复来提升概率。该方法的重要例子包括用于估计流中不同元素数量或估计大集合间集合相似度的小空间算法。使用标准强通用哈希处理每个元素,我们得到一个基于草图的估计量,其误差过大的概率例如为 1/4。通过执行 次独立重复并取估计量的中位数,误差概率随 指数下降。然而,运行 个独立实验会使处理时间增加 倍。在此我们指出,若拥有具有强集中界的哈希函数,则无需任何重复即可获得相同的高概率界。我们不使用 个独立草图,而是使用一个大 倍的单一草图,因此总空间相同。但仅应用单一哈希函数,从而节省 倍时间,且整体算法更为简洁。具有强集中界的快速实用哈希函数最近由 Aamand 等人提出(将发表于 STOC 2020)。利用他们的哈希方案,这些算法因此变得非常快速且实用,适用于高容量数据流在线处理。
引用
@article{arxiv.2004.01156,
title = {No Repetition: Fast Streaming with Highly Concentrated Hashing},
author = {Anders Aamand and Debarati Das and Evangelos Kipouridis and Jakob B. T. Knudsen and Peter M. R. Rasmussen and Mikkel Thorup},
journal= {arXiv preprint arXiv:2004.01156},
year = {2020}
}
备注
10 pages