用于选择K-median聚类数的惩罚准则
统计理论
2024-02-28 v3 统计理论
摘要
聚类是一种常用的无监督机器学习技术,用于根据相似特征将数据点分组。我们在此关注受污染数据的无监督聚类,即由于鲁棒性原因应优先选择K-median而非K-means的情形。更确切地说,我们集中于聚类中的一个常见问题:如何选择聚类数?本文提出的答案是将最优聚类数的选择视为通过惩罚来最小化风险函数。在本文中,我们获得了准则的合适惩罚形式,并推导了相应的 oracle 型不等式。最后,在模拟研究中将该方法与不同类型的K-median算法及其他流行技术进行了性能比较。所有研究的算法均可在CRAN的R包Kmedians中获得。
引用
@article{arxiv.2209.03597,
title = {A penalized criterion for selecting the number of clusters for K-medians},
author = {Antoine Godichon-Baggioni and Sobihan Surendran},
journal= {arXiv preprint arXiv:2209.03597},
year = {2024}
}