中文

基于丰度系数的分类数据聚类最优簇数估计方法

机器学习 2025-01-28 v1

摘要

估计分区聚类中簇数(即 k)的问题是分类聚类的主要挑战之一。本文提出一种名为 k-SCC 的算法,用于估计分类数据聚类中的最优 k。对于聚类步骤,算法采用核密度估计方法来定义聚类中心。此外,它使用基于信息论的异质性来衡量每个聚类中中心与对象的距离。随后采用丰度系数的方法来评估前述步骤中获得的不同聚类质量,以选择最佳 k。在合成数据和真实数据上进行了对比实验,以比较 k-SCC 与另三种算法的性能。实验结果表明,k-SCC 在确定每个数据集的最优簇数方面优于所比较的算法。

关键词

引用

@article{arxiv.2501.15542,
  title  = {Estimating the Optimal Number of Clusters in Categorical Data Clustering by Silhouette Coefficient},
  author = {Duy-Tai Dinh and Tsutomu Fujinami and Van-Nam Huynh},
  journal= {arXiv preprint arXiv:2501.15542},
  year   = {2025}
}