扰动下 Lloyd 算法的一致性
机器学习
2026-04-28 v2 统计理论
统计理论
摘要
在无监督学习的背景下,Lloyd 算法是被最广泛使用的聚类算法之一。它激发了大量研究工作,探讨该算法在具有真实簇的各种设定下的正确性。特别地,2016 年,Lu 和 Zhou 已证明:在适当初始化的假设下,对来自次高斯混合的 个独立样本,Lloyd 算法经过 次迭代后的误聚类率以指数形式有界。然而,在许多应用中,真实样本不可观测,需要通过预处理流程(如适当数据矩阵上的谱方法)从数据中学习。我们证明:在适当初始化且扰动相对于次高斯噪声较小的假设下,对来自次高斯混合的扰动样本,Lloyd 算法经过 次迭代后的误聚类率同样以指数形式有界。在具有真实簇的典型设定中,我们推导了诸如 -means 等算法寻找良好初始化的界,从而通过主要结果得出聚类的正确性。我们展示了这些结果对诸如 SigClust 等从数据度量所得簇的统计显著性的流程的影响。我们利用这些一般结果推导了在大量应用中的启示,为 Lloyd 算法的误聚类率提供理论保证,包括高维时间序列、多维缩放以及通过谱聚类的稀疏网络社区检测。
引用
@article{arxiv.2309.00578,
title = {Consistency of Lloyd's Algorithm Under Perturbations},
author = {Dhruv Patel and Hui Shen and Shankar Bhamidi and Yufeng Liu and Vladas Pipiras},
journal= {arXiv preprint arXiv:2309.00578},
year = {2026}
}