中文

识别离散混合模型中的聚类数量

统计方法学 2014-09-29 v1 其他统计学

摘要

针对分类数据的聚类分析研究持续发展,新的聚类算法不断被提出。然而,在此背景下,聚类数量的确定很少得到解决。在本文中,我们提出了一种新方法,同时进行分类数据的聚类和聚类数量的估计。假设数据源自多项分布的有限混合,我们开发了一种基于最小消息长度 (MML) 准则选择混合分量数量的方法,并实现了一种新的期望最大化 (EM) 算法来估计所有模型参数。所提出的 EM-MML 方法并非从一组预估计的候选模型中选择一个(这需要多次运行 EM),而是在单个算法中无缝集成了估计和模型选择。我们将所提出方法的性能与其他知名准则(如贝叶斯信息准则-BIC)进行了比较,使用了合成数据以及来自欧洲社会调查的两个实际应用。EM-MML 的计算时间是所提出方法的一个明显优势。此外,真实数据的解比竞争方法提供的解更加简约,这降低了模型阶数高估的风险并提高了可解释性。

关键词

引用

@article{arxiv.1409.7419,
  title  = {Identifying the number of clusters in discrete mixture models},
  author = {Cláudia Silvestre and Margarida G. M. S. Cardoso and Mário A. T. Figueiredo},
  journal= {arXiv preprint arXiv:1409.7419},
  year   = {2014}
}