k 是魔法数字——通过非参数集中不等式推断聚类数目
机器学习
2021-08-04 v1 机器学习
摘要
大多数凸和非凸聚类算法都带有一个关键参数:-means 中的 。迄今为止,尚无一种被广泛接受的准确确定该参数的方法。流行的方法简单却缺乏理论依据,例如在给定的代价度量曲线中寻找拐点。相比之下,基于统计学的方法往往对数据分布做出严格假设,或附带自身的聚类目标优化方案。这要么限制了适用数据集的范围,要么限制了聚类算法。在本文中,我们力求通过回答一个简单的问题来确定聚类数目:给定两个簇,它们是否可能共同源自单一分布?为此,我们提出了两个簇源自合并簇之分布的概率的一个界,该界仅由样本均值和方差指定。我们的方法可作为简单封装应用于任何最小化 -means 目标的聚类方法的结果,这包括高斯混合和谱聚类(Spectral Clustering)。我们在实验评估中聚焦于非凸聚类的一个应用,并论证了我们理论结果的适用性。我们的 \textsc{SpecialK} 聚类算法自动确定 的合适取值,无需任何数据变换或投影,且不对数据分布作假设。此外,它能够判定数据仅由单一簇组成,而许多现有算法无法做到这一点。
引用
@article{arxiv.1907.02343,
title = {k is the Magic Number -- Inferring the Number of Clusters Through Nonparametric Concentration Inequalities},
author = {Sibylle Hess and Wouter Duivesteijn},
journal= {arXiv preprint arXiv:1907.02343},
year = {2021}
}