中文

更快且样本量近最优的高斯混合模型正确学习算法

数据结构与算法 2014-05-20 v3 机器学习 概率论 统计理论 统计理论

摘要

我们提出了一种无需任何可分性假设即可正确学习两个单变量高斯混合模型的算法。给定来自未知混合模型的 O~(1/ε2)\tilde{O}(1/\varepsilon^2) 个样本,我们的算法输出一个在总变差距离上 ε\varepsilon-接近的混合模型,时间复杂度为 O~(1/ε5)\tilde{O}(1/\varepsilon^5)。我们的样本复杂度在对数因子内是最优的,并显著优于 Kalai 等人(其算法对 1/ε1/\varepsilon 有禁止性的依赖)和 Feldman 等人(其算法需要对混合参数进行界限约束且在这些参数上呈伪多项式依赖)的工作。我们的主要贡献之一是改进并推广了一种从竞争假设中选择良好候选分布的算法。即,给定包含至少一个与未知分布 ε\varepsilon-接近的候选者的 NN 个假设集合,我们的算法输出一个与该分布 O(ε)O(\varepsilon)-接近的候选者。该算法需要来自未知分布的 O(logN/ε2){O}(\log{N}/\varepsilon^2) 个样本和 O(NlogN/ε2){O}(N \log N/\varepsilon^2) 的时间,这将此前此类结果(如 Scheff\'e 估计量)中运行时间对 NN 的二次依赖改进为准线性依赖。鉴于此类结果在假设选择中的广泛应用,我们改进的算法意味着对任何此类应用的直接改进。

关键词

引用

@article{arxiv.1312.1054,
  title  = {Faster and Sample Near-Optimal Algorithms for Proper Learning Mixtures of Gaussians},
  author = {Constantinos Daskalakis and Gautam Kamath},
  journal= {arXiv preprint arXiv:1312.1054},
  year   = {2014}
}

备注

31 pages, to appear in COLT 2014