Zipf分布下的(学习型)频率估计算法
数据结构与算法
2020-08-12 v2
摘要
数据流中元素的频率是一项重要的统计度量,在数据分析与机器学习中的许多应用里都会涉及对其估计的任务。该问题最流行的两种算法 Count-Min 和 Count-Sketch 在实践中被广泛使用。在最近的工作 [Hsu et al., ICLR'19] 中,经验表明用机器学习算法增强 Count-Min 和 Count-Sketch 可显著减小估计误差。实验辅以对输入频率服从 Zipf 分布时 Count-Min(标准版与增强版)所产生期望误差的分析。尽管作者确立了 Count-Min 的学习版相比标准版具有更低的估计误差,但他们针对标准 Count-Min 算法的分析并不紧;此外,他们未对 Count-Sketch 给出类似分析。本文解决了这些问题。首先,我们给出了 Count-Min 期望误差的一个简单紧分析。其次,我们给出了 Count-Sketch 标准版与增强版的首个误差界。这些界近乎紧,并再次展示了 Count-Sketch 学习版更优的性能。除了展示上述算法间的紧间隙外,我们认为针对 Count-Min 与 Count-Sketch 标准版的界具有独立意义。特别地,通常实践中将这些算法的哈希函数数量设为 。相反,我们的结果表明,为使期望误差最小,哈希函数数量应为严格大于 的常数。
引用
@article{arxiv.1908.05198,
title = {(Learned) Frequency Estimation Algorithms under Zipfian Distribution},
author = {Anders Aamand and Piotr Indyk and Ali Vakilian},
journal= {arXiv preprint arXiv:1908.05198},
year = {2020}
}