中文

关于连续分布信息度量的估计

信息论 2021-11-29 v3 机器学习 math.IT 统计理论 统计理论

摘要

基于样本估计连续分布的信息度量是统计学与机器学习中的基本问题。本文中,我们分析在 KK 维欧几里得空间中,当概率密度函数属于预定凸族 P\mathcal{P} 时,由有限样本数计算的差分熵估计。首先,若 P\mathcal{P} 中密度的差分熵无界,则表明以任意精度估计差分熵不可行,清晰显示了额外假设的必要性。随后,我们研究使差分熵估计能获得置信界的充分条件。特别地,在概率密度函数具有已知 Lipschitz 常数且支撑已知有界的 Lipschitz 连续假设下,我们给出了基于简单直方图的固定样本数差分熵估计的置信界。我们聚焦于差分熵,但也给出例子表明类似结果对互信息与相对熵同样成立。

关键词

引用

@article{arxiv.2002.02851,
  title  = {On the Estimation of Information Measures of Continuous Distributions},
  author = {Georg Pichler and Pablo Piantanida and Günther Koliander},
  journal= {arXiv preprint arXiv:2002.02851},
  year   = {2021}
}

备注

20 pages