中文

学习两个高斯混合模型的紧界

机器学习 2015-05-19 v3 数据结构与算法 机器学习

摘要

我们考虑从一系列独立随机样本中识别未知二维高斯混合模型参数的问题。我们的主要结果是给出了上界和下界,提出了一种具有最优收敛率的计算高效矩估计量,从而解决了 Pearson (1894) 提出的问题。记未知混合模型的方差为 σ2\sigma^2,我们证明了当 d=1d=1 时,需要且仅需 Θ(σ12)\Theta(\sigma^{12}) 个样本即可将每个参数估计到常数加性误差范围内。我们的上界通过一种新颖但简单的降维技术扩展到了任意维度 d>1d>1,仅在 dd 上存在(经证明是必要的)对数损失。我们还确定了若干有趣的特殊情况,其样本复杂度显著低于我们的最优最坏情况界。例如,如果两个分量的均值相距 Ω(σ)\Omega(\sigma),则样本复杂度降至 O(σ2)O(\sigma^2),且这同样是最优的。我们的结果也适用于以总变差距离的小误差学习混合模型的每个分量,在此方面我们的算法在样本复杂度上较先前工作有显著提升。我们还将下界扩展到了 kk 个高斯的混合模型,表明需要 Ω(σ6k2)\Omega(\sigma^{6k-2}) 个样本才能将每个参数估计到常数加性误差范围内。

关键词

引用

@article{arxiv.1404.4997,
  title  = {Tight bounds for learning a mixture of two gaussians},
  author = {Moritz Hardt and Eric Price},
  journal= {arXiv preprint arXiv:1404.4997},
  year   = {2015}
}

备注

STOC 2015