Stars:用于聚类和图学习的太规模图构建
机器学习
2023-01-11 v2 数据结构与算法
摘要
海量数据分析中的一个基本流程是相似图的构建。此类图对许多下游任务起着关键作用,包括聚类、分类、图学习和最近邻搜索。对于这些任务,构建稀疏但仍能代表底层数据的图至关重要。稀疏性的好处有两方面:首先,对于大型数据集,构建稠密图在实践中不可行;其次,下游任务的运行时间直接受相似图稀疏性的影响。在这项工作中,我们提出 :一种通过二跳 spanner 构建极稀疏图的高度可扩展方法,这类图中相似点由长度至多为二的路径相连。Stars 能以显著更少的相似度比较构建二跳 spanner,而相似度比较对于基于学习的模型是主要瓶颈,因其评估代价高昂。理论上,我们证明 Stars 在近似线性时间内构建图,其中近似最近邻包含于二跳邻域内。在实践中,我们已将 Stars 部署于多个数据集,实现了 (即具有数十万亿条边的图)的图构建。我们评估了 Stars 在聚类和图学习上的性能,并展示相较于不同基线,成对相似度比较有 10~1000 倍的提升,运行时间有 2~10 倍的提升且无质量损失。
引用
@article{arxiv.2212.02635,
title = {Stars: Tera-Scale Graph Building for Clustering and Graph Learning},
author = {CJ Carey and Jonathan Halcrow and Rajesh Jayaram and Vahab Mirrokni and Warren Schudy and Peilin Zhong},
journal= {arXiv preprint arXiv:2212.02635},
year = {2023}
}
备注
NeurIPS 2022