中文

Lloyd算法及其变体的统计与计算保障

统计理论 2016-12-08 v1 机器学习 机器学习 统计理论

摘要

聚类是统计学和机器学习中的一个基本问题。Lloyd算法于1957年提出,因其简洁性和经验性能,至今可能仍是实践中最广泛使用的聚类算法。然而,关于Lloyd算法的统计与计算保障,理论研究甚少。本文试图弥合这一实践与理论之间的鸿沟。我们研究了Lloyd算法在聚类次高斯混合分布上的性能。在适当的标签或中心初始化条件下,我们证明Lloyd算法在经过log n量级的迭代后,收敛到指数级小的聚类误差,其中n为样本量。该误差率被证明是极小极大最优的。对于双混合分布情形,我们仅要求初始值略优于随机猜测。此外,我们将Lloyd算法及其分析扩展到社区发现和众包这两个近期在统计学和机器学习领域备受关注的问题。分别为社区发现和众包提出了Lloyd算法的两种变体。在理论方面,我们为这两种算法提供了统计与计算保障,其结果改进了文献中针对这两个问题的一些先前信噪比条件。在模拟和真实数据集上的实验结果表明,我们的算法与最先进方法相比具有竞争性的性能。

关键词

引用

@article{arxiv.1612.02099,
  title  = {Statistical and Computational Guarantees of Lloyd's Algorithm and its Variants},
  author = {Yu Lu and Harrison H. Zhou},
  journal= {arXiv preprint arXiv:1612.02099},
  year   = {2016}
}