中文

贪心 k-means++ 的近乎紧致分析

数据结构与算法 2022-07-19 v1 机器学习

摘要

Arthur 与 Vassilvitskii [SODA 2007] 著名的 kk-means++ 算法是实践中求解 kk-means 问题最流行的方法。该算法非常简单:它均匀随机地采样第一个中心,随后每个后续的 k1k-1 个中心始终按其与当前最近中心的平方距离成比例采样。之后运行 Lloyd 迭代算法。kk-means++ 算法已知在期望下返回 Θ(logk)\Theta(\log k) 近似解。在其开创性工作中,Arthur 与 Vassilvitskii [SODA 2007] 询问了其如下\emph{贪心}变体的保证:在每一步中,我们采样 \ell 个候选中心而非一个,然后选取使新代价最小的那个。这也是 kk-means++ 在例如流行的 Scikit-learn 库 [Pedregosa et al.; JMLR 2011] 中的实现方式。我们给出贪心 kk-means++ 近乎匹配的下界与上界:我们证明其是一个 O(3log3k)O(\ell^3 \log^3 k)-近似算法。另一方面,我们证明一个 Ω(3log3k/log2(logk))\Omega(\ell^3 \log^3 k / \log^2(\ell\log k)) 的下界。此前,仅知一个 Ω(logk)\Omega(\ell \log k) 的下界 [Bhattacharya, Eube, R\"oglin, Schmidt; ESA 2020],且没有已知的上界。

关键词

引用

@article{arxiv.2207.07949,
  title  = {A Nearly Tight Analysis of Greedy k-means++},
  author = {Christoph Grunau and Ahmet Alper Özüdoğru and Václav Rozhoň and Jakub Tětek},
  journal= {arXiv preprint arXiv:2207.07949},
  year   = {2022}
}