中文

改进的 k-means 和 k-GMM 种子初始化策略

机器学习 2025-11-04 v1

摘要

我们重新审视了用于 k-means 聚类和 k-GMM(使用期望最大化拟合高斯混合模型)的随机种子初始化技术,形式化了它们的三个关键要素:用于种子采样的度量、候选种子的数量以及用于种子选择的度量。这一分析产生了新颖的初始化方法族,这些方法利用了一个前瞻原则——使种子选择与用于评估算法的最终度量具有更强的一致性,以及一种多遍策略来抑制随机化的影响。实验表明,在最终度量(k-means 的 SSE,k-GMM 的对数似然)方面,我们的方法相对于经典竞争者实现了一致的常数因子改进,而开销适中。特别是,对于 k-means,我们的方法改进了最近设计的多交换策略,该策略是第一个优于贪心 k-means++ 种子初始化的方法。我们的实验分析还揭示了 k-means 中一些常被忽视的微妙特性,包括种子初始化时的 SSE 与最终 SSE 之间的(缺乏)相关性,迭代种子初始化方法中观察到的方差减少现象,以及贪心方法中最终 SSE 对候选池大小的敏感性。实际上,我们最有效的种子初始化方法有望成为标准技术之一,甚至可能成为标准技术。从理论角度来看,我们对种子初始化的形式化为新的分析方法开辟了道路。

关键词

引用

@article{arxiv.2506.21291,
  title  = {Improved seeding strategies for k-means and k-GMM},
  author = {Guillaume Carrière and Frédéric Cazals},
  journal= {arXiv preprint arXiv:2506.21291},
  year   = {2025}
}

备注

13 pages