小批量核 $k$-均值算法
机器学习
2024-10-10 v1 人工智能
数据结构与算法
摘要
我们提出了第一个小批量核 -均值算法,与全批量算法相比,运行时间提升了一个数量级。我们算法的单次迭代耗时 ,远快于全批量核 -均值所需的 时间,其中 是数据集大小, 是批量大小。大量实验表明,我们的算法始终能实现10-100倍的加速,且质量损失极小,解决了实践中限制核 -均值采用的运行缓慢问题。我们进一步通过早期停止条件下的理论分析补充了这些结果,证明当批量大小为 时,算法以高概率在 次迭代内终止,其中 限制了特征空间中点的范数, 是终止阈值。我们的分析对任何合理的中心初始化都成立,并且当使用 -means++ 初始化时,算法在期望下达到 的近似比。对于归一化核,如高斯核或拉普拉斯核,有 。取 和 ,算法在 次迭代内终止,每次迭代耗时 。
引用
@article{arxiv.2410.05902,
title = {Mini-Batch Kernel $k$-means},
author = {Ben Jourdan and Gregory Schwartzman},
journal= {arXiv preprint arXiv:2410.05902},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2304.00419