亚线性时间内的谱聚类预言机
数据结构与算法
2021-10-20 v2
摘要
给定一个图 ,它可被划分为 个互不相交的扩张图(expander),且外部 conductance 上界为 ,我们能否高效地构建一个占用空间很小的数据结构,用于快速将 的顶点按照其所属的扩张图(簇)进行分类?形式上,我们需要一个高效的局部计算算法,使得每个扩张图中的顶点被误分类的比例至多为 。我们将这种数据结构称为\textit{谱聚类预言机}。我们的主要结果是构建一个谱聚类预言机,其查询时间为 ,预处理时间为 ,并在任意 时为每个簇提供 的误分类误差。更一般地,可以适当以增加预处理时间为代价来降低查询时间(只要二者乘积约为 )——这尤其给出了一个近乎线性的谱聚类原语。主要技术贡献是一个亚线性时间预言机,它通过估计 中顶点的短随机游走分布,提供对 的谱嵌入的点积访问。这些分布本身对谱嵌入的近似很差,但我们证明可以通过一个适当的线性变换来实现高精度的点积访问。接着我们证明,对谱嵌入的点积访问足以设计一个聚类预言机。从高层来看,我们的方法相当于在 的谱嵌入中进行超平面划分,但关键在于在谱嵌入中一组精心定义的嵌套子空间上操作,以实现逐簇恢复保证。
引用
@article{arxiv.2101.05549,
title = {Spectral Clustering Oracles in Sublinear Time},
author = {Grzegorz Gluch and Michael Kapralov and Silvio Lattanzi and Aida Mousavifar and Christian Sohler},
journal= {arXiv preprint arXiv:2101.05549},
year = {2021}
}
备注
Proceedings of the 2021 ACM-SIAM Symposium on Discrete Algorithms (SODA). Society for Industrial and Applied Mathematics, 2021