中文

Stars:用于聚类和图学习的太规模图构建

机器学习 2023-01-11 v2 数据结构与算法

摘要

海量数据分析中的一个基本流程是相似图的构建。此类图对许多下游任务起着关键作用,包括聚类、分类、图学习和最近邻搜索。对于这些任务,构建稀疏但仍能代表底层数据的图至关重要。稀疏性的好处有两方面:首先,对于大型数据集,构建稠密图在实践中不可行;其次,下游任务的运行时间直接受相似图稀疏性的影响。在这项工作中,我们提出 Stars\textit{Stars}:一种通过二跳 spanner 构建极稀疏图的高度可扩展方法,这类图中相似点由长度至多为二的路径相连。Stars 能以显著更少的相似度比较构建二跳 spanner,而相似度比较对于基于学习的模型是主要瓶颈,因其评估代价高昂。理论上,我们证明 Stars 在近似线性时间内构建图,其中近似最近邻包含于二跳邻域内。在实践中,我们已将 Stars 部署于多个数据集,实现了 Tera-Scale\textit{Tera-Scale}(即具有数十万亿条边的图)的图构建。我们评估了 Stars 在聚类和图学习上的性能,并展示相较于不同基线,成对相似度比较有 10~1000 倍的提升,运行时间有 2~10 倍的提升且无质量损失。

关键词

引用

@article{arxiv.2212.02635,
  title  = {Stars: Tera-Scale Graph Building for Clustering and Graph Learning},
  author = {CJ Carey and Jonathan Halcrow and Rajesh Jayaram and Vahab Mirrokni and Warren Schudy and Peilin Zhong},
  journal= {arXiv preprint arXiv:2212.02635},
  year   = {2023}
}

备注

NeurIPS 2022