中文

一种数据驱动的层次聚类簇数估计方法

定量方法 2016-08-17 v1 机器学习 统计方法学

摘要

我们提出两种在层次聚类框架中估计簇数的新方法,旨在创建一个完全自动化、无需人工干预的过程。这些方法完全由数据驱动,无需研究者提供任何输入,因此是完全自动化的。它们非常易于实现,且计算量极小。我们在多个模拟数据集和 Biobase 基因表达数据集上分析了性能,将我们的方法与已建立的 Gap 统计量和 Elbow 方法进行了比较,并在多簇场景中优于两者。

关键词

引用

@article{arxiv.1608.04700,
  title  = {A Data-Driven Approach to Estimating the Number of Clusters in Hierarchical Clustering},
  author = {Antoine Zambelli},
  journal= {arXiv preprint arXiv:1608.04700},
  year   = {2016}
}

备注

6 pages, 7 figures, 12 tables