中文

小批量核 $k$-均值算法

机器学习 2024-10-10 v1 人工智能 数据结构与算法

摘要

我们提出了第一个小批量核 kk-均值算法,与全批量算法相比,运行时间提升了一个数量级。我们算法的单次迭代耗时 O~(kb2)\widetilde{O}(kb^2),远快于全批量核 kk-均值所需的 O(n2)O(n^2) 时间,其中 nn 是数据集大小,bb 是批量大小。大量实验表明,我们的算法始终能实现10-100倍的加速,且质量损失极小,解决了实践中限制核 kk-均值采用的运行缓慢问题。我们进一步通过早期停止条件下的理论分析补充了这些结果,证明当批量大小为 Ω~(max{γ4,γ2}ϵ2)\widetilde{\Omega}(\max \{\gamma^{4}, \gamma^{2}\} \cdot \epsilon^{-2}) 时,算法以高概率在 O(γ2/ϵ)O(\gamma^2/\epsilon) 次迭代内终止,其中 γ\gamma 限制了特征空间中点的范数,ϵ\epsilon 是终止阈值。我们的分析对任何合理的中心初始化都成立,并且当使用 kk-means++ 初始化时,算法在期望下达到 O(logk)O(\log k) 的近似比。对于归一化核,如高斯核或拉普拉斯核,有 γ=1\gamma=1。取 ϵ=O(1)\epsilon = O(1)b=Θ(logn)b=\Theta(\log n),算法在 O(1)O(1) 次迭代内终止,每次迭代耗时 O~(k)\widetilde{O}(k)

关键词

引用

@article{arxiv.2410.05902,
  title  = {Mini-Batch Kernel $k$-means},
  author = {Ben Jourdan and Gregory Schwartzman},
  journal= {arXiv preprint arXiv:2410.05902},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2304.00419