中文

含噪声、贪心与非完全贪心的 k-means++

数据结构与算法 2019-12-03 v1 机器学习

摘要

Arthur 和 Vassilvitskii 提出的 k-means++ 算法已成为 Lloyd 算法最流行的初始化方法。它从数据集中均匀随机地采样第一个中心,其余 k1k-1 个中心根据 D2D^2-采样迭代采样,其中数据点成为下一个中心的概率与其到当前已选最近中心的平方距离成正比。已知 k-means++ 在期望下可达到 O(logk)O(\log k) 的近似因子。早在 k-means++ 的原始论文中,Arthur 和 Vassilvitskii 就提出了一种称为贪心 k-means++ 算法的变体,其中每次迭代根据 D2D^2-采样抽取多个候选中心,仅选取使目标函数下降最多的那个作为该轮的中心。文中提出一个开放问题:这是否也能得到 O(logk)O(\log k)-近似(甚至更好)。我们证明事实并非如此,给出了一族实例,使得贪心 k-means++ 在期望下仅能达到 Ω(logk)\Omega(\ell\cdot \log k)-近似,其中 \ell 为每轮采样的候选中心数。我们还研究了一种变体,称之为含噪声 k-means++ 算法。该变体中每轮仅采样一个中心,但不再严格按 D2D^2-采样。具体而言,每轮允许对手将 D2D^2-采样所得各点的概率单独改变一个介于 1ϵ11-\epsilon_11+ϵ21+\epsilon_2 之间的因子,其中参数 ϵ1[0,1)\epsilon_1 \in [0,1)ϵ20\epsilon_2 \ge 0。我们证明含噪声 k-means++ 在期望下可计算 O(log2k)O(\log^2 k)-近似。我们还讨论了该结果的一些应用。

关键词

引用

@article{arxiv.1912.00653,
  title  = {Noisy, Greedy and Not So Greedy k-means++},
  author = {Anup Bhattacharya and Jan Eube and Heiko Röglin and Melanie Schmidt},
  journal= {arXiv preprint arXiv:1912.00653},
  year   = {2019}
}