高维高斯混合模型的学习
机器学习
2015-03-11 v2
摘要
高效学习高斯混合模型是统计学和学习理论中的一个基本问题。给定来自 Rn 中 k 个高斯分布中随机一个分布的样本,该学习问题要求估计这些高斯的均值和协方差矩阵。这一学习问题出现在从自然科学到社会科学的许多领域,并已在许多机器学习应用中得到使用。不幸的是,学习高斯混合模型是一个信息论上困难的问题:为了将参数学习到合理的精度,在最坏情况下所需样本数随高斯分量数呈指数增长。在本文中,我们表明只要处于足够高的维度,在平滑分析框架下,高斯混合类以其最一般的形式是可学习的,其中参数从对抗性起点被随机扰动。特别地,给定来自具有随机扰动参数的高斯混合模型的样本,当 n > {\Omega}(k^2) 时,我们给出一种算法,以多项式运行时间和多项式样本数学习参数。核心算法思想包括利用高斯混合矩张量的结构特性对其进行分解的新方法。该张量的对称性源自高斯分布高阶矩的组合结构(有时称为伊瑟利斯定理或威克定理)。我们还开发了用于界定结构化随机矩阵最小奇异值的新工具,这可能用于其他平滑分析环境。
引用
@article{arxiv.1503.00424,
title = {Learning Mixtures of Gaussians in High Dimensions},
author = {Rong Ge and Qingqing Huang and Sham M. Kakade},
journal= {arXiv preprint arXiv:1503.00424},
year = {2015}
}