中文

梯度 EM 在过参数化高斯混合模型中的全局收敛性

机器学习 2025-06-10 v1 机器学习

摘要

学习高斯混合模型 (GMM) 是机器学习中的一个基本问题,期望最大化 (EM) 算法及其流行变体梯度 EM 在实际中可能是最广泛使用的算法之一。在精确参数化 setting 中,即地面实验 GMM 和学习模型具有相同的组件数 mm,已有大量工作致力于为 EM 建立严格的恢复保证。然而,仅在 m=2m=2 时才证明了全局收敛性,而 EM 在 m3m\geq 3 时已知会无法恢复地面实验。本文我们考虑 过参数化\textit{过参数化} 的 setting,即学习模型使用 n>mn>m 个组件来拟合 mm 组件的地面实验 GMM。与精确参数化的情况不同,我们为梯度 EM 提供了严格的全局收敛保证。具体而言,对于任何在一般位置下的良好分离的 GMM,我们证明只需轻微的过参数化 n=Ω(mlogm)n = \Omega(m\log m),随机初始化的梯度 EM 在多项式样本下以多项式速率收敛到地面实验。我们的分析分为两个阶段,并引入了一套用于高斯混合分析的新工具。我们使用 Hermite 多项式来研究梯度 EM 的动力学,并采用张量分解来刻画似然损失的几何景观。这是一个在 m=2m=2 之外的 EM 或梯度 EM 的第一个全局收敛和恢复结果。

关键词

引用

@article{arxiv.2506.06584,
  title  = {Global Convergence of Gradient EM for Over-Parameterized Gaussian Mixtures},
  author = {Mo Zhou and Weihang Xu and Maryam Fazel and Simon S. Du},
  journal= {arXiv preprint arXiv:2506.06584},
  year   = {2025}
}

备注

77 pages