中文

基于大规模梯度的因子分析混合模型训练

机器学习 2023-08-29 v1

摘要

高斯混合模型(GMMs)是数据分析中的标准工具。然而,当应用于高维数据(如图像)时,由于所需满协方差矩阵(CMs)的规模问题,它们面临困难;而使用对角或球形 CMs 往往施加过于严苛的限制。因子分析混合(MFA)模型是 GMMs 的重要扩展,它允许基于因子载荷 ll 的数量在对角与满 CMs 之间平滑插值。MFA 已成功应用于高维图像数据建模。本文既给出理论分析,也提出一种通过随机梯度下降高效训练高维 MFA 的新方法,其从随机质心初始化起步。这极大简化了训练与初始化过程,并避免了如期望最大化(EM)等批式算法在海量数据训练时的问题。此外,借助矩阵行列式引理的性质,我们证明 MFA 的训练与推断/采样可基于精度矩阵完成,从而在训练结束后无需矩阵求逆。训练时,该方法仅需对 l×ll\times l 矩阵求逆。除理论分析与证明外,我们将 MFA 应用于 SVHN 与 MNIST 等典型图像数据集,并展示了其执行样本生成与离群点检测的能力。

关键词

引用

@article{arxiv.2308.13778,
  title  = {Large-scale gradient-based training of Mixtures of Factor Analyzers},
  author = {Alexander Gepperth},
  journal= {arXiv preprint arXiv:2308.13778},
  year   = {2023}
}