解决高斯混合模型的多项式可学习性问题
机器学习
2010-04-27 v1 数据结构与算法
摘要
给定来自多元高斯混合模型的数据,一个基本问题是准确估计混合参数。我们针对此问题给出了一种算法,其运行时间和数据需求在维度和期望精度的倒数上是多项式的,且对高斯分布具有可证明的最小假设。作为我们学习算法的简单推论,我们可以高效地对样本点进行近最优聚类,并对 k 个高斯分布的混合进行密度估计。我们算法的构建块基于 Kalai 等人 [STOC 2010] 的工作,该工作通过考虑一系列到一维的投影,并对每个单变量投影应用矩方法,给出了学习两个高斯混合模型的高效算法。Kalai 等人的一个主要技术难题是证明可以高效学习两个高斯分布的单变量混合。相比之下,由于在考虑多于两个高斯分布的混合的单变量投影时可能出现病态场景,本文的大部分工作涉及如何利用学习单变量混合(多个高斯分布)的算法来产生高维学习的高效算法。我们的算法采用层次聚类和重新缩放,以及用于回溯和从单变量算法中可能发生的故障中恢复的精细方法。最后,虽然我们算法的运行时间和数据需求依赖于混合中高斯分布的数量呈指数增长,但我们证明这种依赖是必要的。
引用
@article{arxiv.1004.4223,
title = {Settling the Polynomial Learnability of Mixtures of Gaussians},
author = {Ankur Moitra and Gregory Valiant},
journal= {arXiv preprint arXiv:1004.4223},
year = {2010}
}
备注
43 pages, 2 figures