面向频率凹次线性函数的采样草图
数据结构与算法
2019-12-24 v3
摘要
我们考虑由建模为键值对的元素组成的海量分布式数据集,以及计算统计量或聚合值的任务,其中每个键的贡献由其频率(其元素值之和)的函数加权。这一基础问题在数据分析与机器学习中有大量应用,尤其是使用频率的凹次线性函数可缓解高频键的不成比例影响。凹次线性函数族包括低频矩()、封顶、对数及其复合。一种常见方法是采样键,理想情况下按其贡献比例采样,并从样本中估计统计量。一种简单但代价高昂的方式是聚合数据以生成键及其频率的表,对频率值应用我们的函数,然后应用加权采样方案。我们的主要贡献是设计了可组合采样草图,可针对任意频率凹次线性函数定制。我们的草图结构大小非常接近所需样本大小,且我们的样本对估计质量提供统计保证,非常接近在聚合数据上计算的同等大小理想样本。最后,我们通过实验证明了方法的简洁性与有效性。
引用
@article{arxiv.1907.02218,
title = {Sampling Sketches for Concave Sublinear Functions of Frequencies},
author = {Edith Cohen and Ofir Geri},
journal= {arXiv preprint arXiv:1907.02218},
year = {2019}
}
备注
Full version of a NeurIPS 2019 paper