中文

利用流式数据学习高斯混合模型

机器学习 2017-07-11 v1 机器学习

摘要

本文研究了利用流式数据学习高斯混合模型的问题:给定由未知的 kk 个球面高斯分布混合生成的 dd 维空间中的 NN 个点流,目标是通过单次遍历数据流来估计模型参数。我们分析了流行的 Lloyd 启发式算法的流式版本,并表明如果各分量高斯分布的中心充分分离,该算法能准确估计所有未知中心。假设每对中心相距 CσC\sigma,其中 C=Ω((klogk)1/4σ)C=\Omega((k\log k)^{1/4}\sigma),且 σ2\sigma^2 为任意高斯分量的最大方差,我们证明该算法在渐近意义上能以最优精度(至多相差常数因子)估计中心;我们的中心分离要求与球面高斯分布的已知最佳结果一致 \citep{vempalawang}。对于有限样本,我们表明基于初始估计的偏差项以 O(1/poly(N))O(1/{\rm poly}(N)) 的速率减小,而方差以接近最优的 σ2d/N\sigma^2 d/N 速率减小。我们的分析要求用真实聚类中心的良好初始估计来初始化算法,为此我们提供了一种基于在线 PCA 的聚类算法。事实上,我们算法的渐近每步时间复杂度为最优的 dkd\cdot k,空间复杂度为 O(dklogk)O(dk\log k)。除了趋于 0 的偏差和方差项外,基于硬阈值的流式 Lloyd 算法更新对数据分布不可知,因此会产生不可避免的近似误差。然而,通过使用经典(基于软阈值)EM 方法的流式版本并显式利用高斯分布,我们表明对于两个高斯分布的混合,可以一致地估计真实均值,其估计误差以接近最优的速率减小,并在 NN\rightarrow \infty 时趋于 0。

关键词

引用

@article{arxiv.1707.02391,
  title  = {Learning Mixture of Gaussians with Streaming Data},
  author = {Aditi Raghunathan and Ravishankar Krishnaswamy and Prateek Jain},
  journal= {arXiv preprint arXiv:1707.02391},
  year   = {2017}
}

备注

20 pages, 1 figure