数据集中的簇数量:一种正则化 K-means 方法
机器学习
2025-05-30 v1 计算机视觉与模式识别
摘要
在无标签数据集中寻找有意义的簇数量在许多应用中非常重要。正则化 k-means 算法是一种常用于在数据集中寻找正确簇数量的可行方法。正则化函数最常见的公式是加性线性项 ,其中 是簇的数量, 是一个正系数。目前,没有原则性的指南来设置关键超参数 的值。在本文中,我们假设簇是理想的,推导出了 的严格界限。理想簇(定义为具有相同半径的 维球体)是 k-means 簇(具有相同标准差的 维球对称分布)的近似代理。实验表明,带有加性正则化项的 k-means 算法通常会产生多个解。因此,我们还分析了带有乘性正则化项的 k-means 算法。带有加性和乘性正则化的 k-means 解之间的共识在某些情况下减少了多个解的歧义。我们还展示了精选实验,证明了当簇偏离理想假设时正则化 k-means 算法的性能。
关键词
引用
@article{arxiv.2505.22991,
title = {Number of Clusters in a Dataset: A Regularized K-means Approach},
author = {Behzad Kamgar-Parsi and Behrooz Kamgar-Parsi},
journal= {arXiv preprint arXiv:2505.22991},
year = {2025}
}
备注
19 pages, 14 figures. arXiv admin note: substantial text overlap with arXiv:1911.06741