大规模图构建:并查集洗牌
分布式、并行与集群计算
2021-01-26 v2 数据结构与算法
摘要
使用分布式计算框架的大规模图处理在工业界正变得普遍且高效。在这项工作中,我们提出了一种高度可扩展且可配置的分布式算法用于构建连通分量,称为带路径压缩的并查集洗牌(UFS)。该算法的规模和复杂度是数据初始划分的分区数以及连通分量大小的函数。我们讨论了复杂度以及与类似方法的基准比较。我们还展示了我们的生产系统的当前基准,其运行在商品化开箱即用云 Hadoop 基础设施上,该算法于一年多前部署,已扩展到约 750 亿节点和 600 亿连接(且仍在增长)。我们强调了算法的关键方面,使其即使在存在每个规模达 100 亿节点的偏斜大连通分量数据时,也能实现无缝扩展与性能。
引用
@article{arxiv.2012.05430,
title = {Building Graphs at a Large Scale: Union Find Shuffle},
author = {Saigopal Thota and Mridul Jain and Nishad Kamat and Saikiran Malikireddy and Pruthvi Raj Eranti and Albin Kuruvilla},
journal= {arXiv preprint arXiv:2012.05430},
year = {2021}
}