识别离散混合模型中的聚类数量
统计方法学
2014-09-29 v1 其他统计学
摘要
针对分类数据的聚类分析研究持续发展,新的聚类算法不断被提出。然而,在此背景下,聚类数量的确定很少得到解决。在本文中,我们提出了一种新方法,同时进行分类数据的聚类和聚类数量的估计。假设数据源自多项分布的有限混合,我们开发了一种基于最小消息长度 (MML) 准则选择混合分量数量的方法,并实现了一种新的期望最大化 (EM) 算法来估计所有模型参数。所提出的 EM-MML 方法并非从一组预估计的候选模型中选择一个(这需要多次运行 EM),而是在单个算法中无缝集成了估计和模型选择。我们将所提出方法的性能与其他知名准则(如贝叶斯信息准则-BIC)进行了比较,使用了合成数据以及来自欧洲社会调查的两个实际应用。EM-MML 的计算时间是所提出方法的一个明显优势。此外,真实数据的解比竞争方法提供的解更加简约,这降低了模型阶数高估的风险并提高了可解释性。
引用
@article{arxiv.1409.7419,
title = {Identifying the number of clusters in discrete mixture models},
author = {Cláudia Silvestre and Margarida G. M. S. Cardoso and Mário A. T. Figueiredo},
journal= {arXiv preprint arXiv:1409.7419},
year = {2014}
}