中文

k-均值与信息 k-均值的新界

统计理论 2021-02-09 v2 统计理论

摘要

本文中,我们针对可分 Hilbert 空间中 i.i.d 样本量化相关的二次 k-均值超额风险,推导出一个新的无维数非渐近上界。我们改进了 Biau、Devroye 和 Lugosi 的 O(k/n)\mathcal{O} \bigl( k / \sqrt{n} \bigr) 阶界,恢复了 Fefferman、Mitter 和 Narayanan 以及 Klochkov、Kroshnin 和 Zhivotovskiy 已证明的 k/n\sqrt{k/n} 速率,但后者的对数因子与常数更差。更精确地,在有界情形 P(XB)=1\mathbb{P}( \lVert X \rVert \leq B) = 1 下,我们将经验最小化子的平均超额风险界定为显式上界 16B2log(n/k)klog(k)/n16 B^2 \log(n/k) \sqrt{k \log(k) / n}。这在对数因子意义下基本最优,因为在维数 dd 中已知 O(k14/d/n)\mathcal{O} \bigl( \sqrt{k^{1 - 4/d}/n} \bigr) 阶下界。我们的证明技术基于通过核技巧对 k-均值准则进行线性化,以及 PAC-Bayesian 不等式。为获得 1/n1 / \sqrt{n} 速度,我们引入了一种新的 PAC-Bayesian 链接方法,以无限维高斯过程对参数扰动来替代 δ\delta-网概念。同时,我们将通常的 k-均值准则嵌入到基于 Kullback 散度及其底层性质构建的更广义族中。这产生了一种我们命名为信息 k-均值的新算法,非常适用于词袋的聚类。基于信息论的考量,我们还引入了一种新的有界 k-均值准则,其使用一个尺度参数但满足一个不要求样本有任何有界性甚至可积性条件的泛化界。我们描述了 Lloyd 算法的对应版本,并证明了这些新 k-均值准则的泛化界。

关键词

引用

@article{arxiv.2101.05728,
  title  = {New bounds for $k$-means and information $k$-means},
  author = {Gautier Appert and Olivier Catoni},
  journal= {arXiv preprint arXiv:2101.05728},
  year   = {2021}
}