中文

扰动下 Lloyd 算法的一致性

机器学习 2026-04-28 v2 统计理论 统计理论

摘要

在无监督学习的背景下,Lloyd 算法是被最广泛使用的聚类算法之一。它激发了大量研究工作,探讨该算法在具有真实簇的各种设定下的正确性。特别地,2016 年,Lu 和 Zhou 已证明:在适当初始化的假设下,对来自次高斯混合的 nn 个独立样本,Lloyd 算法经过 O(log(n))O(\log(n)) 次迭代后的误聚类率以指数形式有界。然而,在许多应用中,真实样本不可观测,需要通过预处理流程(如适当数据矩阵上的谱方法)从数据中学习。我们证明:在适当初始化且扰动相对于次高斯噪声较小的假设下,对来自次高斯混合的扰动样本,Lloyd 算法经过 O(log(n))O(\log(n)) 次迭代后的误聚类率同样以指数形式有界。在具有真实簇的典型设定中,我们推导了诸如 kk-means++++ 等算法寻找良好初始化的界,从而通过主要结果得出聚类的正确性。我们展示了这些结果对诸如 SigClust 等从数据度量所得簇的统计显著性的流程的影响。我们利用这些一般结果推导了在大量应用中的启示,为 Lloyd 算法的误聚类率提供理论保证,包括高维时间序列、多维缩放以及通过谱聚类的稀疏网络社区检测。

关键词

引用

@article{arxiv.2309.00578,
  title  = {Consistency of Lloyd's Algorithm Under Perturbations},
  author = {Dhruv Patel and Hui Shen and Shankar Bhamidi and Yufeng Liu and Vladas Pipiras},
  journal= {arXiv preprint arXiv:2309.00578},
  year   = {2026}
}