具有最小独立性的Bottom-k与优先级采样、集合相似度及子集和
数据结构与算法
2013-06-12 v2
摘要
我们考虑集合X的bottom-k采样,选取由给定哈希函数h确定的k个最小元素构成样本S_k(X)。利用该样本,我们可以估计任意子集Y的相对大小f=|Y|/|X|为|S_k(X) ∩ Y|/k。一个标准应用是估计集合A与B之间的Jaccard相似度f=|A ∩ B|/|A ∪ B|。给定A和B的bottom-k样本后,我们构造其并集的bottom-k样本为S_k(A ∪ B)=S_k(S_k(A) ∪ S_k(B)),然后相似度估计为|S_k(A ∪ B) ∩ S_k(A) ∩ S_k(B)|/k。我们在此证明,即使哈希函数仅为2-独立,期望相对误差为O(1/√(fk))。当fk=Ω(1)时,这与真正随机哈希下的期望相对误差相差常数因子。作为对比,考虑经典的kxmin-wise方法,其中使用k个独立哈希函数h_1,...,h_k,存储每个哈希函数的最小元素。对于kxmin-wise,在常数独立下存在至少常数偏差,且不会随k增大而减小。最近Feigenblat等人表明,若哈希函数为8-独立且k足够大,bottom-k可避免偏差。我们将要求降至任意k下的2-独立。我们的结果基于简单的联合界,将哈希方案的通用集中界转移到bottom-k样本,例如在更高独立性下获得更强的概率误差界。对于加权集,我们考虑优先级采样,它能有效适应具体输入权重,例如从重尾输入中显著受益。此时分析复杂得多,但我们再次表明通用集中界可以应用。
引用
@article{arxiv.1303.5479,
title = {Bottom-k and Priority Sampling, Set Similarity and Subset Sums with Minimal Independence},
author = {Mikkel Thorup},
journal= {arXiv preprint arXiv:1303.5479},
year = {2013}
}
备注
A short version appeared at STOC'13