中文

随机 k-means 的收敛速率

机器学习 2016-11-17 v1

摘要

我们分析了在线和 mini-batch k-means 变体。两者均通过随机近似扩展了广泛使用的 k-means 算法,并已在大规模聚类和无监督特征学习中流行起来。我们首次证明,从任意初始解出发,它们在一般条件下以 O(1/t) 的速率(就 k-means 目标而言)收敛到一个“局部最优”。此外,我们证明,如果数据集是可聚类的,当使用一种简单且可扩展的种子算法初始化时,mini-batch k-means 以高概率以 O(1/t) 的速率收敛到最优 k-means 解。k-means 目标是非凸且不可微的:我们借鉴了近期关于非凸问题随机梯度下降研究的思想,通过对 k-means 算法在其解空间上的轨迹提供新颖刻画,并借助关于 k-means 更新的几何洞察绕过了不可微性问题。

关键词

引用

@article{arxiv.1611.05132,
  title  = {Convergence rate of stochastic k-means},
  author = {Cheng Tang and Claire Monteleoni},
  journal= {arXiv preprint arXiv:1611.05132},
  year   = {2016}
}

备注

arXiv admin note: substantial text overlap with arXiv:1610.04900