贪心 k-means++ 的近乎紧致分析
数据结构与算法
2022-07-19 v1 机器学习
摘要
Arthur 与 Vassilvitskii [SODA 2007] 著名的 -means++ 算法是实践中求解 -means 问题最流行的方法。该算法非常简单:它均匀随机地采样第一个中心,随后每个后续的 个中心始终按其与当前最近中心的平方距离成比例采样。之后运行 Lloyd 迭代算法。-means++ 算法已知在期望下返回 近似解。在其开创性工作中,Arthur 与 Vassilvitskii [SODA 2007] 询问了其如下\emph{贪心}变体的保证:在每一步中,我们采样 个候选中心而非一个,然后选取使新代价最小的那个。这也是 -means++ 在例如流行的 Scikit-learn 库 [Pedregosa et al.; JMLR 2011] 中的实现方式。我们给出贪心 -means++ 近乎匹配的下界与上界:我们证明其是一个 -近似算法。另一方面,我们证明一个 的下界。此前,仅知一个 的下界 [Bhattacharya, Eube, R\"oglin, Schmidt; ESA 2020],且没有已知的上界。
引用
@article{arxiv.2207.07949,
title = {A Nearly Tight Analysis of Greedy k-means++},
author = {Christoph Grunau and Ahmet Alper Özüdoğru and Václav Rozhoň and Jakub Tětek},
journal= {arXiv preprint arXiv:2207.07949},
year = {2022}
}