中文

k-means-u* 算法:非局部跳跃与贪婪重试改进 k-means++ 聚类

机器学习 2017-07-18 v2

摘要

我们提出一种称为 k-means-u* 的新聚类算法,其在许多情况下能够显著改进由 k-means++(当前欧几里得空间聚类的实际标准)发现的聚类结果。首先我们介绍 k-means-u 算法,其从 k-means++ 的结果出发,并尝试通过一系列非局部“跳跃”与标准 k-means 运行交替来改进它。每次跳跃将“最无用”的中心移向具有最大局部误差的中心,并偏移一个小的随机向量。只要误差减小就继续,这常导致改进的解。偶尔 k-means-u 会在存在明显剩余优化可能时终止。通过允许对最后一次跳跃进行有限次数的重试,常有可能达到更好的局部极小值。所得算法称为 k-means-u*,并且在解质量上主导 k-means++,这通过使用各种数据集的经验得以证明。根据构造,为 k-means++ 建立的对数质量界对 k-means-u* 同样成立。

关键词

引用

@article{arxiv.1706.09059,
  title  = {The k-means-u* algorithm: non-local jumps and greedy retries improve k-means++ clustering},
  author = {Bernd Fritzke},
  journal= {arXiv preprint arXiv:1706.09059},
  year   = {2017}
}

备注

submitted to JMLR (38 pages, 36 figures, 4 algorithms)