中文

数据放大:一种统一且具有竞争力的属性估计方法

机器学习 2019-04-02 v1 机器学习 统计理论 统计理论

摘要

估计离散分布的性质是统计学习中的基本问题。我们设计了首个统一的、线性时间的、具有竞争力的属性估计器,该估计器对于一大类性质与所有底层分布,仅使用 2n2n 个样本即可达到经验估计器用 nlognn\sqrt{\log n} 个样本所实现的性能。这提供了现成的、与分布无关的、相对于常规做法估计器的数据量的“放大”。我们通过将其与现有针对多种性质与分布的估计器进行比较,说明了该估计器的实际优势。在大多数情况下,其使用 nn 个样本的性能甚至与经验估计器使用 nlognn\log n 个样本的性能一样好,并且对几乎所有性质,其性能都可媲美专为该性质设计的最佳现有估计器。

关键词

引用

@article{arxiv.1904.00070,
  title  = {Data Amplification: A Unified and Competitive Approach to Property Estimation},
  author = {Yi Hao and Alon Orlitsky and Ananda T. Suresh and Yihong Wu},
  journal= {arXiv preprint arXiv:1904.00070},
  year   = {2019}
}

备注

In NeurIPS 2018