中文

一种改进权衡的 $k$-$\mathtt{means}$++ 拒绝采样新方法

数据结构与算法 2025-02-05 v1 机器学习

摘要

kk-means\mathtt{means}++ 种子算法 (Arthur & Vassilvitskii, 2007) 在实践中被广泛用于 kk-均值聚类问题,其目标是将数据集 XRd\mathcal{X} \subset \mathbb{R} ^d 聚类为 kk 个簇。该算法的流行源于其简单性以及可证明的在期望上比最优解差 O(logk)O(\log k) 倍的竞争力保证。然而,其运行时间为 O(Xkd)O(|\mathcal{X}|kd),这使得它在处理大型数据集时成本高昂。在这项工作中,我们提出了一种简单有效的基于拒绝采样的方法来加速 kk-means\mathtt{means}++。我们的第一种方法运行时间为 O~(nnz(X)+βk2d)\tilde{O}(\mathtt{nnz} (\mathcal{X}) + \beta k^2d),同时在期望上仍保持 O(logk)O(\log k) 的竞争力。这里,β\beta 是一个参数,表示数据集方差与期望最优 kk-means\mathtt{means} 代价的比值,而 O~\tilde{O} 隐藏了 kkX|\mathcal{X}| 中的对数因子。我们的第二种方法在计算成本和求解质量之间提供了一种新的权衡。它在 kk-means\mathtt{means}++ 的 O(logk)O(\log k) 保证之外,额外增加了一个尺度不变的因子 kΩ(m/β)Var(X) k^{-\Omega( m/\beta)} \operatorname{Var} (\mathcal{X}),改进了 (Bachem et al, 2016a) 的结果,后者在运行时间仍为 O~(nnz(X)+mk2d)\tilde{O}(\mathtt{nnz}(\mathcal{X}) + mk^2d) 的同时,额外增加了一个 m1Var(X)m^{-1}\operatorname{Var}(\mathcal{X}) 因子。我们进行了广泛的实证评估,以验证我们的理论结果,并展示我们的方法在真实数据集上的有效性。

关键词

引用

@article{arxiv.2502.02085,
  title  = {A New Rejection Sampling Approach to $k$-$\mathtt{means}$++ With Improved Trade-Offs},
  author = {Poojan Shah and Shashwat Agrawal and Ragesh Jaiswal},
  journal= {arXiv preprint arXiv:2502.02085},
  year   = {2025}
}