中文

任意数据流上的在线 $k$-means 聚类

机器学习 2022-08-02 v4 数据结构与算法

摘要

我们考虑在线 kk-means 聚类:每个新点被分配给最近的聚类中心,之后算法可更新其中心。产生的损失为新点到其被分配聚类中心的平方距离之和。在数据流 XX 上的目标是使损失达到 L(X,OPTk)L(X, OPT_k)(即事后使用 kk 个固定点所能获得的最佳损失)的常数倍。我们提出一个数据参数 Λ(X)\Lambda(X),使得对于任何在时刻 nn 维护 O(kpoly(logn))O(k\text{poly}(\log n)) 个中心的算法,都存在一个数据流 XX 使其不可避免地承受 Ω(Λ(X))\Omega(\Lambda(X)) 的损失。随后我们给出一种随机化算法,其聚类损失为 O(Λ(X)+L(X,OPTk))O(\Lambda(X) + L(X, OPT_k))。我们的算法使用 O(kpoly(logn))O(k\text{poly}(\log n)) 内存并维护 O(kpoly(logn))O(k\text{poly}(\log n)) 个聚类中心。该算法运行时间为 O(kpoly(logn))O(k\text{poly}(\log n)),是此设定下首个达到多项式空间与时间复杂度的算法,也是首个在不对输入数据做任何假设下具有可证明保证的算法。

关键词

引用

@article{arxiv.2102.09101,
  title  = {Online $k$-means Clustering on Arbitrary Data Streams},
  author = {Robi Bhattacharjee and Jacob Imola and Michal Moshkovitz and Sanjoy Dasgupta},
  journal= {arXiv preprint arXiv:2102.09101},
  year   = {2022}
}