中文

一种近乎最优且不可知的算法:用于任意常数k的k个高斯混合的正确学习

数据结构与算法 2015-06-04 v1 信息论 机器学习 math.IT 统计理论 统计理论

摘要

学习高斯混合模型(GMM)是机器学习、学习理论和统计学中的基本问题。学习GMM的一种概念是正确学习:此处目标是找到由kk个高斯组成的混合M\mathcal{M},它接近于我们抽取样本未知分布密度ffM\mathcal{M}ff间的距离通常在全变分或L1L_1范数下度量。我们给出一种学习kk个单变量高斯混合的算法,对任意固定kk近乎最优。我们算法的样本复杂度为O~(kϵ2)\tilde{O}(\frac{k}{\epsilon^2}),运行时间为(klog1ϵ)O(k4)+O~(kϵ2)(k \cdot \log\frac{1}{\epsilon})^{O(k^4)} + \tilde{O}(\frac{k}{\epsilon^2})。众所周知该样本复杂度是最优的(至对数因子),且已被先前工作实现。然而,正确学习kk-GMM的最佳已知时间复杂度为O~(1ϵ3k1)\tilde{O}(\frac{1}{\epsilon^{3k-1}})。特别地,1ϵ\frac{1}{\epsilon}kk之间的依赖是指数级的。我们通过将1ϵ\frac{1}{\epsilon}项替换为log1ϵ\log \frac{1}{\epsilon}同时仅适度增加指数,显著改善了该依赖。因此,对任意固定kkO~(kϵ2)\tilde{O} (\frac{k}{\epsilon^2})项主导我们的运行时间,从而我们的算法运行时间几乎与抽取样本数线性相关。实现对kk-GMM正确学习的poly(k,1ϵ)\textrm{poly}(k, \frac{1}{\epsilon})运行时间最近被多位研究者列为开放问题,我们在此问题上取得进展。此外,我们的方法提供不可知学习保证:即使我们采样分布不是高斯混合,算法也返回好的GMM。据我们所知,我们的算法是首个用于GMM的不可知正确学习算法。

关键词

引用

@article{arxiv.1506.01367,
  title  = {A Nearly Optimal and Agnostic Algorithm for Properly Learning a Mixture of k Gaussians, for any Constant k},
  author = {Jerry Li and Ludwig Schmidt},
  journal= {arXiv preprint arXiv:1506.01367},
  year   = {2015}
}