大规模 k 均值聚类:基于种子近似最近邻搜索的可扩展方法
机器学习
2025-02-11 v1 计算几何
机器学习
摘要
对于非常大的值 ,我们考虑对 规模数据进行快速 -means 聚类,这些数据在高维空间()中。所有当前实际方法至少具有 的运行时间。我们发现,初始化程序不是这类问题的瓶颈。相反,提高 Lloyd 的局部搜索算法速度尤为关键,尤其是将点重新分配到最近中心的步骤。尝试改进这一步本质上会导致我们利用近似最近邻搜索方法,尽管这本身尚不足以实用。相反,我们提出了一类称为“种子近似最近邻搜索”的问题,并作为解决方案提出了“种子搜索图”方法。
引用
@article{arxiv.2502.06163,
title = {Scalable k-Means Clustering for Large k via Seeded Approximate Nearest-Neighbor Search},
author = {Jack Spalding-Jamieson and Eliot Wong Robson and Da Wei Zheng},
journal= {arXiv preprint arXiv:2502.06163},
year = {2025}
}
备注
29 pages, 8 figures