中文

呼吸 K-Means:通过动态 K 值获得更优 K-Means 解

机器学习 2024-08-20 v5 机器学习

摘要

我们提出呼吸 k-means 算法,其平均显著改进了广为人知的贪心 k-means++ 算法(scikit-learn 包中 k-means 聚类的默认方法)所获得的解。改进通过一种新颖的“呼吸”技术实现,该技术基于局部误差和效用度量循环增减质心数量。我们以贪心 k-means++ 为基线进行实验,将其与呼吸 k-means 及另外五种 k-means 算法比较。在所研究的方法中,仅呼吸 k-means 与 better k-means++ 持续优于基线,其中呼吸 k-means 表现出显著领先。即便将所有其他算法十次运行的最佳结果与呼吸 k-means 单次运行比较,其优越性能依然保持,凸显了它的有效性与速度。我们的发现表明呼吸 k-means 算法优于其他 k-means 技术,尤其是十次重复的贪心 k-means++,它在解质量与速度上均占优。这使得呼吸 k-means(内置由单次贪心 k-means++ 初始化)成为单独运行贪心 k-means++ 的更优替代方案。

关键词

引用

@article{arxiv.2006.15666,
  title  = {Breathing K-Means: Superior K-Means Solutions through Dynamic K-Values},
  author = {Bernd Fritzke},
  journal= {arXiv preprint arXiv:2006.15666},
  year   = {2024}
}

备注

v5: Title changed to better address the core contribution. Terminology unified. v4: 40 pages, 10 figures, 19 tables; Algorithm has been compared to five additional k-means algorithms (beneath greedy k-means++). Five different groups of test problems have been investigated. Python package: https://pypi.org/project/bkmeans