中文

面向频率凹次线性函数的采样草图

数据结构与算法 2019-12-24 v3

摘要

我们考虑由建模为键值对的元素组成的海量分布式数据集,以及计算统计量或聚合值的任务,其中每个键的贡献由其频率(其元素值之和)的函数加权。这一基础问题在数据分析与机器学习中有大量应用,尤其是使用频率的凹次线性函数可缓解高频键的不成比例影响。凹次线性函数族包括低频矩(p1p \leq 1)、封顶、对数及其复合。一种常见方法是采样键,理想情况下按其贡献比例采样,并从样本中估计统计量。一种简单但代价高昂的方式是聚合数据以生成键及其频率的表,对频率值应用我们的函数,然后应用加权采样方案。我们的主要贡献是设计了可组合采样草图,可针对任意频率凹次线性函数定制。我们的草图结构大小非常接近所需样本大小,且我们的样本对估计质量提供统计保证,非常接近在聚合数据上计算的同等大小理想样本。最后,我们通过实验证明了方法的简洁性与有效性。

关键词

引用

@article{arxiv.1907.02218,
  title  = {Sampling Sketches for Concave Sublinear Functions of Frequencies},
  author = {Edith Cohen and Ofir Geri},
  journal= {arXiv preprint arXiv:1907.02218},
  year   = {2019}
}

备注

Full version of a NeurIPS 2019 paper