中文

CAS 压缩加速丝绸分析:一种高效确定 K 均值聚类最优 K 值的方法

机器学习 2025-07-14 v1

摘要

聚类是当今数据驱动环境中决策的关键组成部分,广泛应用于生物信息学、社交网络分析和图像处理等多个领域。然而,聚类精度在大规模数据集上仍是主要挑战。本文综合概述了选择聚类最优 k 值策略,着重实现复杂数据环境下的聚类精度与计算效率之间的平衡。此外,本文介绍了针对文本和图像数据的聚类技术改进,为更好的计算性能和聚类有效性提供见解。该方法基于压缩丝绸 (Condensed Silhouette) 方法,结合统计方法如局部结构 (Local Structures)、间隙统计 (Gap Statistics)、类别一致性比 (Class Consistency Ratio) 以及基于 CCR 和 COI 的聚类重叠指数算法,用于计算 K 均值聚类的最佳 k 值。通过对比实验结果表明,所提出的方法在高维数据集上实现了最高可达 99% 的执行时间提升,同时保持精度和可扩展性,非常适用于实时聚类需求或资源受限的高效聚类场景。

关键词

引用

@article{arxiv.2507.08311,
  title  = {CAS Condensed and Accelerated Silhouette: An Efficient Method for Determining the Optimal K in K-Means Clustering},
  author = {Krishnendu Das and Sumit Gupta and Awadhesh Kumar},
  journal= {arXiv preprint arXiv:2507.08311},
  year   = {2025}
}