中文

亚线性时间内的谱聚类预言机

数据结构与算法 2021-10-20 v2

摘要

给定一个图 GG,它可被划分为 kk 个互不相交的扩张图(expander),且外部 conductance 上界为 ϵ1\epsilon\ll 1,我们能否高效地构建一个占用空间很小的数据结构,用于快速将 GG 的顶点按照其所属的扩张图(簇)进行分类?形式上,我们需要一个高效的局部计算算法,使得每个扩张图中的顶点被误分类的比例至多为 O(ϵ)O(\epsilon)。我们将这种数据结构称为\textit{谱聚类预言机}。我们的主要结果是构建一个谱聚类预言机,其查询时间为 O(n1/2+O(ϵ))O^*(n^{1/2+O(\epsilon)}),预处理时间为 2O(1ϵk4log2(k))n1/2+O(ϵ)2^{O(\frac{1}{\epsilon} k^4 \log^2(k))} n^{1/2+O(\epsilon)},并在任意 ϵ1/logk\epsilon \ll 1/\log k 时为每个簇提供 O(ϵlogk)O(\epsilon \log k) 的误分类误差。更一般地,可以适当以增加预处理时间为代价来降低查询时间(只要二者乘积约为 n1+O(ϵ)n^{1+O(\epsilon)})——这尤其给出了一个近乎线性的谱聚类原语。主要技术贡献是一个亚线性时间预言机,它通过估计 GG 中顶点的短随机游走分布,提供对 GG 的谱嵌入的点积访问。这些分布本身对谱嵌入的近似很差,但我们证明可以通过一个适当的线性变换来实现高精度的点积访问。接着我们证明,对谱嵌入的点积访问足以设计一个聚类预言机。从高层来看,我们的方法相当于在 GG 的谱嵌入中进行超平面划分,但关键在于在谱嵌入中一组精心定义的嵌套子空间上操作,以实现逐簇恢复保证。

关键词

引用

@article{arxiv.2101.05549,
  title  = {Spectral Clustering Oracles in Sublinear Time},
  author = {Grzegorz Gluch and Michael Kapralov and Silvio Lattanzi and Aida Mousavifar and Christian Sohler},
  journal= {arXiv preprint arXiv:2101.05549},
  year   = {2021}
}

备注

Proceedings of the 2021 ACM-SIAM Symposium on Discrete Algorithms (SODA). Society for Industrial and Applied Mathematics, 2021