利用流式数据学习高斯混合模型
机器学习
2017-07-11 v1 机器学习
摘要
本文研究了利用流式数据学习高斯混合模型的问题:给定由未知的 个球面高斯分布混合生成的 维空间中的 个点流,目标是通过单次遍历数据流来估计模型参数。我们分析了流行的 Lloyd 启发式算法的流式版本,并表明如果各分量高斯分布的中心充分分离,该算法能准确估计所有未知中心。假设每对中心相距 ,其中 ,且 为任意高斯分量的最大方差,我们证明该算法在渐近意义上能以最优精度(至多相差常数因子)估计中心;我们的中心分离要求与球面高斯分布的已知最佳结果一致 \citep{vempalawang}。对于有限样本,我们表明基于初始估计的偏差项以 的速率减小,而方差以接近最优的 速率减小。我们的分析要求用真实聚类中心的良好初始估计来初始化算法,为此我们提供了一种基于在线 PCA 的聚类算法。事实上,我们算法的渐近每步时间复杂度为最优的 ,空间复杂度为 。除了趋于 0 的偏差和方差项外,基于硬阈值的流式 Lloyd 算法更新对数据分布不可知,因此会产生不可避免的近似误差。然而,通过使用经典(基于软阈值)EM 方法的流式版本并显式利用高斯分布,我们表明对于两个高斯分布的混合,可以一致地估计真实均值,其估计误差以接近最优的速率减小,并在 时趋于 0。
引用
@article{arxiv.1707.02391,
title = {Learning Mixture of Gaussians with Streaming Data},
author = {Aditi Raghunathan and Ravishankar Krishnaswamy and Prateek Jain},
journal= {arXiv preprint arXiv:1707.02391},
year = {2017}
}
备注
20 pages, 1 figure