中文

k 是魔法数字——通过非参数集中不等式推断聚类数目

机器学习 2021-08-04 v1 机器学习

摘要

大多数凸和非凸聚类算法都带有一个关键参数:kk-means 中的 kk。迄今为止,尚无一种被广泛接受的准确确定该参数的方法。流行的方法简单却缺乏理论依据,例如在给定的代价度量曲线中寻找拐点。相比之下,基于统计学的方法往往对数据分布做出严格假设,或附带自身的聚类目标优化方案。这要么限制了适用数据集的范围,要么限制了聚类算法。在本文中,我们力求通过回答一个简单的问题来确定聚类数目:给定两个簇,它们是否可能共同源自单一分布?为此,我们提出了两个簇源自合并簇之分布的概率的一个界,该界仅由样本均值和方差指定。我们的方法可作为简单封装应用于任何最小化 kk-means 目标的聚类方法的结果,这包括高斯混合和谱聚类(Spectral Clustering)。我们在实验评估中聚焦于非凸聚类的一个应用,并论证了我们理论结果的适用性。我们的 \textsc{SpecialK} 聚类算法自动确定 kk 的合适取值,无需任何数据变换或投影,且不对数据分布作假设。此外,它能够判定数据仅由单一簇组成,而许多现有算法无法做到这一点。

关键词

引用

@article{arxiv.1907.02343,
  title  = {k is the Magic Number -- Inferring the Number of Clusters Through Nonparametric Concentration Inequalities},
  author = {Sibylle Hess and Wouter Duivesteijn},
  journal= {arXiv preprint arXiv:1907.02343},
  year   = {2021}
}