一种数据驱动的层次聚类簇数估计方法
定量方法
2016-08-17 v1 机器学习
统计方法学
摘要
我们提出两种在层次聚类框架中估计簇数的新方法,旨在创建一个完全自动化、无需人工干预的过程。这些方法完全由数据驱动,无需研究者提供任何输入,因此是完全自动化的。它们非常易于实现,且计算量极小。我们在多个模拟数据集和 Biobase 基因表达数据集上分析了性能,将我们的方法与已建立的 Gap 统计量和 Elbow 方法进行了比较,并在多簇场景中优于两者。
引用
@article{arxiv.1608.04700,
title = {A Data-Driven Approach to Estimating the Number of Clusters in Hierarchical Clustering},
author = {Antoine Zambelli},
journal= {arXiv preprint arXiv:1608.04700},
year = {2016}
}
备注
6 pages, 7 figures, 12 tables