中文

大规模 k 均值聚类:基于种子近似最近邻搜索的可扩展方法

机器学习 2025-02-11 v1 计算几何 机器学习

摘要

对于非常大的值 kk,我们考虑对 10710910^7\sim10^9 规模数据进行快速 kk-means 聚类,这些数据在高维空间(d100d\geq100)中。所有当前实际方法至少具有 Ω(k2)\Omega(k^2) 的运行时间。我们发现,初始化程序不是这类问题的瓶颈。相反,提高 Lloyd 的局部搜索算法速度尤为关键,尤其是将点重新分配到最近中心的步骤。尝试改进这一步本质上会导致我们利用近似最近邻搜索方法,尽管这本身尚不足以实用。相反,我们提出了一类称为“种子近似最近邻搜索”的问题,并作为解决方案提出了“种子搜索图”方法。

关键词

引用

@article{arxiv.2502.06163,
  title  = {Scalable k-Means Clustering for Large k via Seeded Approximate Nearest-Neighbor Search},
  author = {Jack Spalding-Jamieson and Eliot Wong Robson and Da Wei Zheng},
  journal= {arXiv preprint arXiv:2502.06163},
  year   = {2025}
}

备注

29 pages, 8 figures