用于确定数据集中正确簇数的惩罚k-means算法
机器学习
2019-11-18 v1 机器学习
摘要
在许多应用中,我们希望找到数据集中的簇数。一种常见的方法是使用带有关于簇数线性的加性惩罚项的惩罚 k-means 算法。一个开放问题是估计该惩罚项系数的取值。由于以原则性方式估计该系数对于一般簇而言似乎难以处理,我们研究“理想簇”,即无重叠、无离群背景噪声的相同球形簇。在本文中:(a) 针对理想簇情形,我们推导了加性惩罚系数的严格界。不出所料,这些界依赖于我们想要首先找到的正确簇数。我们进一步表明,即便对于理想簇这一最简单情形,加性惩罚通常对正确簇数产生微弱且常含糊的信号。(b) 作为替代,我们考察了带乘性惩罚的 k-means,并表明这种无参数公式对正确簇数具有更强且较少含糊的信号。我们还实证研究了偏离理想簇假设的某些类型,并表明结合加性与乘性惩罚的 k-means 可解决含糊解。
引用
@article{arxiv.1911.06741,
title = {Penalized k-means algorithms for finding the correct number of clusters in a dataset},
author = {Behzad Kamgar-Parsi and Behrooz Kamgar-Parsi},
journal= {arXiv preprint arXiv:1911.06741},
year = {2019}
}
备注
15 pages, 8 figures