中文

基于模型的聚类中变量选择的模型选择与正则化方法比较

应用统计 2013-07-31 v1

摘要

我们比较了聚类中变量选择的两种主要方法:模型选择和正则化。基于先前的结果,我们选择了 Maugis 等人 (2009b) 的方法(该方法改进了 Raftery 和 Dean (2006) 的方法)作为当前最先进的模型选择方法。我们选择了 Witten 和 Tibshirani (2010) 的方法作为当前最先进的正则化方法。我们通过模拟实验比较了这两种方法在分类和变量选择方面的准确性。在第一个模拟实验中,所有变量在给定聚类成员身份的条件下是条件独立的。我们发现,当聚类分离良好时,变量选择(无论是哪种类型)都能显著提高分类准确性,而当聚类彼此接近时,提升甚微。我们发现这两种变量选择方法具有相当的分类准确性,但模型选择方法在变量选择方面的准确性显著更高。在第二个模拟实验中,给定聚类成员身份后变量之间存在相关性。我们发现,在分类和变量选择方面,模型选择方法都比正则化方法准确得多,并且两者都比不进行变量选择的 KK-means 方法能提供更准确的分类结果。

关键词

引用

@article{arxiv.1307.7860,
  title  = {Comparing Model Selection and Regularization Approaches to Variable Selection in Model-Based Clustering},
  author = {Gilles Celeux and Marie-Laure Martin-Magniette and Cathy Maugis-Rabusseau and Adrian E. Raftery},
  journal= {arXiv preprint arXiv:1307.7860},
  year   = {2013}
}