一种改进权衡的 $k$-$\mathtt{means}$++ 拒绝采样新方法
数据结构与算法
2025-02-05 v1 机器学习
摘要
-++ 种子算法 (Arthur & Vassilvitskii, 2007) 在实践中被广泛用于 -均值聚类问题,其目标是将数据集 聚类为 个簇。该算法的流行源于其简单性以及可证明的在期望上比最优解差 倍的竞争力保证。然而,其运行时间为 ,这使得它在处理大型数据集时成本高昂。在这项工作中,我们提出了一种简单有效的基于拒绝采样的方法来加速 -++。我们的第一种方法运行时间为 ,同时在期望上仍保持 的竞争力。这里, 是一个参数,表示数据集方差与期望最优 - 代价的比值,而 隐藏了 和 中的对数因子。我们的第二种方法在计算成本和求解质量之间提供了一种新的权衡。它在 -++ 的 保证之外,额外增加了一个尺度不变的因子 ,改进了 (Bachem et al, 2016a) 的结果,后者在运行时间仍为 的同时,额外增加了一个 因子。我们进行了广泛的实证评估,以验证我们的理论结果,并展示我们的方法在真实数据集上的有效性。
引用
@article{arxiv.2502.02085,
title = {A New Rejection Sampling Approach to $k$-$\mathtt{means}$++ With Improved Trade-Offs},
author = {Poojan Shah and Shashwat Agrawal and Ragesh Jaiswal},
journal= {arXiv preprint arXiv:2502.02085},
year = {2025}
}