中文

高维数据聚类中簇数与特征稀疏性的同时估计

统计方法学 2019-09-05 v1

摘要

估计簇数(K)是聚类分析中的关键且通常困难的任务。已有许多方法被提出用于估计 K,其中包括一些使用重采样方法的顶尖表现者。在对高维数据进行聚类分析时,需要同时进行聚类和特征选择以改进解释性与性能。据我们所知,尚无人研究探索性聚类分析中 K 与特征选择的同时估计。本文中,我们提出一种重采样方法以填补此空白,并在稀疏 K-means 聚类框架下评估其性能。所提出的目标函数在全数据与子抽样数据聚类中成对样本聚类评价的灵敏度与特异度之间取得平衡。通过大量模拟,该方法在低维数据估计 K 上表现优于经典方法。对于高维模拟数据,它在同时估计 K 与特征稀疏性参数上也展现出优越性能。最后,我们在四个微阵列、两个 RNA-seq、一个 SNP 和两个非组学数据集上评估了这些方法。所提方法在几乎所有实际应用中以更少选定预测基因实现了更好聚类精度。

关键词

引用

@article{arxiv.1909.01930,
  title  = {Simultaneous Estimation of Number of Clusters and Feature Sparsity in Clustering High-Dimensional Data},
  author = {Yujia Li and Xiangrui Zeng and Chien-Wei Lin and George Tseng},
  journal= {arXiv preprint arXiv:1909.01930},
  year   = {2019}
}

备注

The earlier version won 2019 ENAR distinguished student paper award