中文

基于平方和的降维与非球形混合的改进聚类算法

数据结构与算法 2024-11-20 v1 机器学习 机器学习

摘要

我们开发了一种聚类非球形(即任意分量协方差)高斯混合模型的新方法,其核心子程序基于平方和方法,能够找到输入数据的保持分离性的低维投影。我们的方法给出了 Vempala 和 Wang [VW04] 著名的球形聚类算法中经典降维方法(基于奇异值分解,是该算法及其他若干应用的关键组件)的非球形类比。作为应用,我们获得了以下算法:(1) 使用 npoly(d)f(wmin1)n\geq \operatorname{poly}(d) f(w_{\min}^{-1}) 个样本和 poly(n)\operatorname{poly}(n) 时间,对 kk 个中心化(即零均值)高斯分布的任意全变差分离混合进行聚类;(2) 使用 ndO(logwmin1)f(wmin1)n \geq d^{O(\log w_{\min}^{-1})} f(w_{\min}^{-1}) 个样本和 nO(logwmin1)n^{O(\log w_{\min}^{-1})} 时间,对具有相同但任意未知协方差的 kk 个高斯分布的任意全变差分离混合进行聚类。此处,wminw_{\min} 是输入混合的最小混合权重,ff 不依赖于维度 dd。我们的算法可自然地推广至容忍与维度无关比例的任意离群点。在此工作之前,最先进的非球形聚类算法中的技术需要 dO(k)f(wmin1)d^{O(k)} f(w_{\min}^{-1}) 的时间和样本来聚类此类混合。在针对聚类非球形高斯混合的 dΩ(k)d^{\Omega(k)} 统计查询下界 [DKS17] 的背景下,我们的结果可能令人意外。尽管该下界通常被认为排除了该问题代价为 do(k)d^{o(k)} 的算法,但我们的结果表明,对于一类极其广泛的高斯混合,该下界实际上是可以被绕过的。

关键词

引用

@article{arxiv.2411.12438,
  title  = {Dimension Reduction via Sum-of-Squares and Improved Clustering Algorithms for Non-Spherical Mixtures},
  author = {Prashanti Anderson and Mitali Bafna and Rares-Darius Buhai and Pravesh K. Kothari and David Steurer},
  journal= {arXiv preprint arXiv:2411.12438},
  year   = {2024}
}

备注

64 pages