中文

k近邻距离分析及其在熵估计中的应用

统计理论 2016-07-22 v2 信息论 math.IT 机器学习 统计理论

摘要

一致地估计熵与互信息对许多机器学习应用十分重要。Kozachenko-Leonenko (KL) 估计器 (Kozachenko & Leonenko, 1987) 是一种广泛使用的非参数估计器,用于多元连续随机变量的熵估计,也是 Kraskov 等人 (2004) 互信息估计器的基础,后者可能是该场景下使用最广泛的互信息估计器。尽管这些估计器具有实际重要性,关于其有限样本行为的重大理论问题仍然未解。本文证明了 KL 估计器偏差与方差的有限样本界限,表明其对于某些平滑函数类达到极小极大收敛速率。在证明这些界限时,我们分析了 k 近邻 (k-NN) 距离统计量(KL 估计器所基于的)的有限样本行为。我们推导了 k-NN 距离的浓度不等式,以及 k-NN 距离统计量的一般期望界限,这可能有助于其他 k-NN 方法的分析。

关键词

引用

@article{arxiv.1603.08578,
  title  = {Analysis of k-Nearest Neighbor Distances with Application to Entropy Estimation},
  author = {Shashank Singh and Barnabás Póczos},
  journal= {arXiv preprint arXiv:1603.08578},
  year   = {2016}
}