通过成对最近邻平滑系统性且高效地改进 $k$-means 初始化
机器学习
2022-12-12 v4 机器学习
摘要
我们提出一种用于初始化(播种)-means 聚类算法的元方法,称为 PNN-smoothing。其做法是将给定数据集划分为 个随机子集,分别对每个子集进行聚类,并使用成对最近邻(PNN)方法合并所得聚类结果。之所以称为元方法,是因为在对各个子集聚类时可使用任意播种算法。若该播种算法的计算复杂度关于数据规模 和簇数 为线性,则通过适当选择 ,PNN-smoothing 也近乎线性,且在实际应用中颇具竞争力。我们利用多种现有播种方法并在多个合成与真实数据集上测试,经验性地表明该过程可系统性地获得更优代价。特别地,我们增强 -means++ 播种的方法在效果与速度上均优于流行的“贪婪” -means++ 变体。我们的实现已在 https://github.com/carlobaldassi/KMeansPNNSmoothing.jl 公开。
引用
@article{arxiv.2202.03949,
title = {Systematically and efficiently improving $k$-means initialization by pairwise-nearest-neighbor smoothing},
author = {Carlo Baldassi},
journal= {arXiv preprint arXiv:2202.03949},
year = {2022}
}
备注
https://openreview.net/forum?id=FTtFAg3pek 16 pages (+8 appendix), 2 figures, 4 tables (+14 appendix). Transactions on Machine Learning Research, Dec 2022