中文

Kullback-Leibler 散度下高概率近最小逼近离散分布估计

机器学习 2026-02-23 v3 机器学习

摘要

我们考虑在 Kullback-Leibler 散度下以高概率估计域大小为 KK 的离散分布的基本问题。我们给出 minimax 估计速率的上界和下界,表明最优速率在样本数为 nn、错误概率为 δ\delta 时,在 (K+ln(K)ln(1/δ))/n\big(K + \ln(K)\ln(1/\delta)\big) /n(Klnln(K)+ln(K)ln(1/δ))/n\big(K\ln\ln(K) + \ln(K)\ln(1/\delta)\big) /n 之间,这在 KK 上的双对数因子 lnlnK\ln \ln K 上将其固定。我们的上界使用在线学习技术通过在线-批处理转换构建一种新型估计器。或许出乎意料的是,minimax 速率的尾行为不如平方总变动和平方 Hellinger 距离更差,后者的尾行为为 (K+ln(1/δ))/n\big(K + \ln(1/\delta)\big) /n,即没有 lnK\ln K 乘以 ln(1/δ)\ln (1/\delta)。因此,我们无法从对这些较小距离的常规约化来获得完全紧密的下界。此外,我们表明这一下界无法通过基于假设检验的标准下界方法实现,反而需要引入我们称为弱假设检验的新型约化。我们进一步在更精细的结果中探讨了与其他距离之间的差距,表明在排除概率小于 O(ln(K/δ)/n)O(\ln(K/\delta) / n) 的结果后,总变动速率可在 Kullback-Leibler 散度下实现(实际上由最大似然估计实现)。这解释了为何 minimax Kullback-Leibler 估计比渐近估计更困难。

关键词

引用

@article{arxiv.2507.17316,
  title  = {Nearly Minimax Discrete Distribution Estimation in Kullback-Leibler Divergence with High Probability},
  author = {Dirk van der Hoeven and Julia Olkhovskaia and Tim van Erven},
  journal= {arXiv preprint arXiv:2507.17316},
  year   = {2026}
}