任意数据流上的在线 $k$-means 聚类
机器学习
2022-08-02 v4 数据结构与算法
摘要
我们考虑在线 -means 聚类:每个新点被分配给最近的聚类中心,之后算法可更新其中心。产生的损失为新点到其被分配聚类中心的平方距离之和。在数据流 上的目标是使损失达到 (即事后使用 个固定点所能获得的最佳损失)的常数倍。我们提出一个数据参数 ,使得对于任何在时刻 维护 个中心的算法,都存在一个数据流 使其不可避免地承受 的损失。随后我们给出一种随机化算法,其聚类损失为 。我们的算法使用 内存并维护 个聚类中心。该算法运行时间为 ,是此设定下首个达到多项式空间与时间复杂度的算法,也是首个在不对输入数据做任何假设下具有可证明保证的算法。
关键词
引用
@article{arxiv.2102.09101,
title = {Online $k$-means Clustering on Arbitrary Data Streams},
author = {Robi Bhattacharjee and Jacob Imola and Michal Moshkovitz and Sanjoy Dasgupta},
journal= {arXiv preprint arXiv:2102.09101},
year = {2022}
}