中文

基于 MPI 自适应采样的介数中心性近似在十亿级边规模上的扩展

分布式、并行与集群计算 2019-10-25 v1 数据结构与算法 社会与信息网络

摘要

介数中心性是网络分析中最常用的顶点中心性度量之一。因此,人们设计了众多(串行与并行)算法来计算或近似介数。近期的算法进展使得在共享内存架构上非常高效地近似介数成为可能。然而,即便是最先进的共享内存算法,对于大型图仍可能需要数小时运行时间,尤其是高直径图或要求较小相对误差时。在本工作中,我们提出了最先进共享内存介数近似算法的基于 MPI 的泛化版本。该算法基于自适应采样;我们的并行化策略同样可应用于其他问题的自适应采样算法。在 16 节点集群上的实验中,仅考虑我们的并行化重点——自适应采样阶段——时,我们基于 MPI 的实现比最先进的共享内存实现快 16.1 倍。对于完整算法,我们相对于最先进水平获得了平均(几何平均)7.4 倍的加速比。对于一些此前极具挑战性的输入,该加速比还要高得多。结果表明,我们的算法首次在不到十分钟内以高精度近似具有数十亿条边的图的介数中心性。

关键词

引用

@article{arxiv.1910.11039,
  title  = {Scaling Betweenness Approximation to Billions of Edges by MPI-based Adaptive Sampling},
  author = {Alexander van der Grinten and Henning Meyerhenke},
  journal= {arXiv preprint arXiv:1910.11039},
  year   = {2019}
}