中文

估计离散分布的Rényi熵

信息论 2016-03-11 v3 数据结构与算法 机器学习 math.IT

摘要

最近研究表明,估计离散k符号分布p的香农熵H(p)需要Θ(k/log k)个样本,这个数量随支撑集大小近线性增长。在许多应用中,H(p)可以被更一般的α阶Rényi熵H_α(p)替代。我们确定了估计所有α的H_α(p)所需的样本数,表明α < 1需要超线性,大约k^{1/α}个样本,非整数α>1需要近线性k个样本,但令人惊讶的是,整数α>1只需要Θ(k^{1-1/α})个样本。此外,基于最近建立的多项式逼近与形如∑_x f(p_x)的加性函数估计之间的联系,我们将非整数α值的样本复杂度比经验估计器降低了log k倍。达到这些界的估计器简单且运行时间与样本数成线性关系。我们的下界提供了具有不同Rényi熵的分布的显式构造,这些分布难以区分。

关键词

引用

@article{arxiv.1408.1000,
  title  = {Estimating Renyi Entropy of Discrete Distributions},
  author = {Jayadev Acharya and Alon Orlitsky and Ananda Theertha Suresh and Himanshu Tyagi},
  journal= {arXiv preprint arXiv:1408.1000},
  year   = {2016}
}