中文

QuicK-means:通过学习快速变换加速 K-means

机器学习 2019-08-26 v1 机器学习

摘要

K-means——以及著名的 Lloyd 算法——已远超其最初设计的聚类方法范畴。它确实被证明有助于提升许多机器学习与数据分析技术(如索引、最近邻搜索与预测、数据压缩)的速度;其有益用途已表明可延续到核机器(当使用 Nyström 方法时)的加速中。在此,我们提出一种 K-means 的快速扩展,称为 QuicK-means,其基于将 KK 个质心组成的矩阵表示为稀疏矩阵之积的思想,这一成果得益于近期致力于将矩阵近似为稀疏因子之积的研究。使用此种分解将因子化后的 K×DK \times D 质心矩阵 U\mathbf{U} 与任意向量之间的矩阵-向量乘积复杂度从 O(KD)\mathcal{O}(K D) 压缩至 O(AlogA+B)\mathcal{O}(A \log A+B),其中 A=min(K,D)A=\min (K, D)B=max(K,D)B=\max (K, D)DD 为训练数据的维数。这一剧烈的计算节省在点分配到簇的过程中具有直接影响,意味着它不仅在预测时可见,而且在训练时也可见,前提是分解过程在 Lloyd 算法期间执行。我们确切地表明,在每次迭代中借助分解步骤并不会损害优化方案的收敛性,并且根据上下文,它可能带来训练时间的减少。最后,我们给出讨论与数值模拟,展示了我们计算高效的 QuicK-means 算法的多用性。

关键词

引用

@article{arxiv.1908.08713,
  title  = {QuicK-means: Acceleration of K-means by learning a fast transform},
  author = {Luc Giffon and Valentin Emiya and Liva Ralaivola and Hachem Kadri},
  journal= {arXiv preprint arXiv:1908.08713},
  year   = {2019}
}