半随机高斯混合模型的聚类
数据结构与算法
2017-11-27 v1 机器学习
摘要
高斯混合模型(GMM)是 -means 聚类问题最广泛使用的统计模型,并构成了机器学习与数据分析中聚类的流行框架。在本文中,我们提出一个推广高斯混合模型的自然半随机模型用于 -means 聚类,我们相信它有助于识别鲁棒算法。在我们的模型中,一个半随机对手可对从高斯混合模型生成的数据进行任意“单调”或有助的改动。我们的第一个贡献是一个多项式时间算法,在分量间有一定分离的条件下,以高概率可证明地将真实簇恢复至较小分类误差内。或许令人惊讶的是,我们所分析的算法是实践中首选的流行的 Lloyd 算法(用于 -means 聚类)。我们的第二个结果通过给出在半随机模型下任何 -means 聚类算法所产生的误分类点数的近乎匹配的信息论下界,对上界作了补充。
引用
@article{arxiv.1711.08841,
title = {Clustering Semi-Random Mixtures of Gaussians},
author = {Pranjal Awasthi and Aravindan Vijayaraghavan},
journal= {arXiv preprint arXiv:1711.08841},
year = {2017}
}