中文

使用k-means算法学习高斯混合模型

机器学习 2009-12-02 v1

摘要

欧几里得空间中最流行的聚类算法之一是kk-means算法;kk-means难以进行数学分析,关于它的理论保证很少,特别是当数据是{\em良好聚类}时。在本文中,我们试图通过分析kk-means在良好聚类数据上的行为来填补文献中的这一空白。特别地,我们研究了每个聚类分布为不同高斯分布的情况——或者换句话说,当输入来自高斯混合模型时。我们在此假设下分析了kk-means算法的三个方面。首先,我们表明,当输入来自两个球面高斯分布的混合时,2-means算法的一个变体成功分离了包含混合分量均值的子空间。其次,当输入是来自球面高斯混合的非常大数量的样本时,我们展示了我们的2-means算法变体收敛的精确表达式。我们的分析不需要对混合分量之间的分离度有任何下界。最后,我们研究了kk-means的样本需求;对于两个球面高斯分布的混合,我们展示了2-means的一个变体为接近真实解所需的样本数量的上界。样本需求随着数据维度的增加以及高斯分布均值之间分离度的减小而增加。为了匹配我们的上界,我们展示了任何学习两个球面高斯混合的算法的信息论下界;我们的下界表明,当两个分布的概率质量之间的重叠很小时,kk-means的样本需求是{\em接近最优}的。

关键词

引用

@article{arxiv.0912.0086,
  title  = {Learning Mixtures of Gaussians using the k-means Algorithm},
  author = {Kamalika Chaudhuri and Sanjoy Dasgupta and Andrea Vattani},
  journal= {arXiv preprint arXiv:0912.0086},
  year   = {2009}
}