中文

通过简约污染混合模型进行高维无监督分类

统计方法学 2019-08-30 v4 应用统计 统计计算

摘要

污染高斯分布代表了高斯分布的一种简单的重尾椭圆推广;与经常考虑的 t 分布不同,它还允许以有限混合模型背景下通常将观测值分配给组别的方式,自动检测轻微的离群点或“坏”点。从该分布出发,我们提出了污染因子分析模型,作为一种在高维数据中进行降维和检测坏点的方法。由此衍生出污染高斯因子分析器混合(MCGFA)模型,并将最近提出的污染高斯分布混合推广到高维数据。我们通过对一般 MCGFA 模型的协方差和污染结构引入约束,引入了一族 32 个简约模型。我们概述了一种用于参数估计的期望最大化算法变体。讨论了各种实现问题,并在模拟数据和真实数据上将这一新颖模型族与成熟的方法进行了比较。

关键词

引用

@article{arxiv.1408.2128,
  title  = {High-dimensional unsupervised classification via parsimonious contaminated mixtures},
  author = {Antonio Punzo and Martin Blostein and Paul D. McNicholas},
  journal= {arXiv preprint arXiv:1408.2128},
  year   = {2019}
}