欧几里得 k-means 稳定实例的聚类
机器学习
2017-12-05 v1 数据结构与算法
摘要
欧几里得 k-means 问题可以说是机器学习中研究最广泛的聚类问题。尽管 k-means 目标在最坏情况下是 NP-hard 的,但实践者在应用如 Lloyd 算法等启发式方法时取得了显著成功。为解释这一脱节,我们研究以下问题:真实世界实例的哪些性质能使我们设计高效算法并证明找到最优聚类的保证?我们考虑一种称为加性扰动稳定性的自然概念,相信它刻画了许多实际实例。稳定实例具有唯一的最优 k-means 解,即使每个点被轻微扰动(在欧几里得距离下)也不会改变。这刻画了 k-means 最优解应对点的测量误差和不确定性具有容忍度的性质。我们设计了高效算法,可证明地恢复加性扰动稳定实例的最优聚类。当实例具有某种额外分离度时,我们展示了一种同样对离群点鲁棒且带可证明保证的高效算法。我们通过研究真实数据集中的稳定程度并证明我们的算法在这些基准数据集上表现良好,补充了这些结果。
引用
@article{arxiv.1712.01241,
title = {Clustering Stable Instances of Euclidean k-means},
author = {Abhratanu Dutta and Aravindan Vijayaraghavan and Alex Wang},
journal= {arXiv preprint arXiv:1712.01241},
year = {2017}
}
备注
23 pages, 2 figures, appearing in NIPS 2017