一种近乎最优且不可知的算法:用于任意常数k的k个高斯混合的正确学习
数据结构与算法
2015-06-04 v1 信息论
机器学习
math.IT
统计理论
统计理论
摘要
学习高斯混合模型(GMM)是机器学习、学习理论和统计学中的基本问题。学习GMM的一种概念是正确学习:此处目标是找到由个高斯组成的混合,它接近于我们抽取样本未知分布密度。与间的距离通常在全变分或范数下度量。我们给出一种学习个单变量高斯混合的算法,对任意固定近乎最优。我们算法的样本复杂度为,运行时间为。众所周知该样本复杂度是最优的(至对数因子),且已被先前工作实现。然而,正确学习-GMM的最佳已知时间复杂度为。特别地,与之间的依赖是指数级的。我们通过将项替换为同时仅适度增加指数,显著改善了该依赖。因此,对任意固定,项主导我们的运行时间,从而我们的算法运行时间几乎与抽取样本数线性相关。实现对-GMM正确学习的运行时间最近被多位研究者列为开放问题,我们在此问题上取得进展。此外,我们的方法提供不可知学习保证:即使我们采样分布不是高斯混合,算法也返回好的GMM。据我们所知,我们的算法是首个用于GMM的不可知正确学习算法。
引用
@article{arxiv.1506.01367,
title = {A Nearly Optimal and Agnostic Algorithm for Properly Learning a Mixture of k Gaussians, for any Constant k},
author = {Jerry Li and Ludwig Schmidt},
journal= {arXiv preprint arXiv:1506.01367},
year = {2015}
}