中文

无限因子分析器的无限混合模型

统计方法学 2021-07-15 v6

摘要

基于因子分析的高斯混合模型常被用作对高维数据进行聚类的基于模型的方法。通常,聚类数和潜在因子数必须在模型拟合前预先指定,并保持固定。然后选择使某个模型选择准则最优的那对数值。出于计算原因,不同聚类中潜在因子数不同的模型很少被考虑。本文引入了无限无限因子分析器(IMIFA)模型。IMIFA采用Pitman-Yor过程先验,利用 stick-breaking 构造和切片采样器来自动推断聚类数量。此外,IMIFA采用乘法伽马过程收缩先验以允许聚类特定的因子数量,并通过自适应吉布斯采样器自动推断。IMIFA作为因子分析混合模型族中的旗舰模型被提出,为聚类高维数据提供了灵活的方法。在基准数据集、代谢组学光谱数据以及流形学习手写数字示例上的应用展示了IMIFA模型及其优势特征。这些特征包括:免除对模型选择准则的需要、减轻与模型空间搜索相关的计算负担、通过允许聚类特定因子数来改善聚类性能,以及量化聚类数和聚类特定因子的不确定性。

关键词

引用

@article{arxiv.1701.07010,
  title  = {Infinite Mixtures of Infinite Factor Analysers},
  author = {Keefe Murphy and Cinzia Viroli and Isobel Claire Gormley},
  journal= {arXiv preprint arXiv:1701.07010},
  year   = {2021}
}

备注

Published in Bayesian Analysis