中文

通过成对最近邻平滑系统性且高效地改进 $k$-means 初始化

机器学习 2022-12-12 v4 机器学习

摘要

我们提出一种用于初始化(播种)kk-means 聚类算法的元方法,称为 PNN-smoothing。其做法是将给定数据集划分为 JJ 个随机子集,分别对每个子集进行聚类,并使用成对最近邻(PNN)方法合并所得聚类结果。之所以称为元方法,是因为在对各个子集聚类时可使用任意播种算法。若该播种算法的计算复杂度关于数据规模 NN 和簇数 kk 为线性,则通过适当选择 JJ,PNN-smoothing 也近乎线性,且在实际应用中颇具竞争力。我们利用多种现有播种方法并在多个合成与真实数据集上测试,经验性地表明该过程可系统性地获得更优代价。特别地,我们增强 kk-means++ 播种的方法在效果与速度上均优于流行的“贪婪” kk-means++ 变体。我们的实现已在 https://github.com/carlobaldassi/KMeansPNNSmoothing.jl 公开。

关键词

引用

@article{arxiv.2202.03949,
  title  = {Systematically and efficiently improving $k$-means initialization by pairwise-nearest-neighbor smoothing},
  author = {Carlo Baldassi},
  journal= {arXiv preprint arXiv:2202.03949},
  year   = {2022}
}

备注

https://openreview.net/forum?id=FTtFAg3pek 16 pages (+8 appendix), 2 figures, 4 tables (+14 appendix). Transactions on Machine Learning Research, Dec 2022