中文

GraNNDis:面向大规模集群上深度 GNN 的高效统一分布式训练框架

机器学习 2024-08-14 v2 分布式、并行与集群计算

摘要

图神经网络(GNNs)是深度学习中快速增长的领域之一。尽管已有许多分布式 GNN 训练框架被提出以提高训练吞吐量,但应用于多服务器集群时面临三个局限。1)由于未考虑多服务器集群的代表性特征——服务器间与服务器内带宽差距,它们遭遇服务器间通信瓶颈。2)冗余的内存使用与计算阻碍了分布式框架的可扩展性。3)作为小批量训练事实标准的采样方法,在多服务器集群中引入不必要的误差。我们发现这些局限可通过利用多服务器集群的特性加以解决。在此我们提出 GraNNDis,一种面向多服务器集群的快速分布式 GNN 训练框架。首先,我们提出 Flexible Preloading(灵活预加载),按服务器预加载必要的顶点依赖以减少低带宽的服务器间通信。其次,我们引入 Cooperative Batching(协作批处理),利用高带宽的服务器内通信实现内存高效、低冗余的小批量训练。第三,我们提出 Expansion-aware Sampling(扩展感知采样),一种集群感知的采样方法,对影响系统加速的边进行采样。由于服务器内依赖通过快速服务器内链路通信,对其采样对加速贡献不大,故该方法仅以服务器边界为采样目标。最后,我们引入 One-Hop Graph Masking(一跳图掩码),一种在多服务器环境中实现上述方法的计算与通信结构。我们在多服务器集群上评估了 GraNNDis,其相较最先进的分布式 GNN 训练框架实现了显著加速。GraNNDis 已在 https://github.com/AIS-SNU/GraNNDis_Artifact 开源以促进使用。

关键词

引用

@article{arxiv.2311.06837,
  title  = {GraNNDis: Efficient Unified Distributed Training Framework for Deep GNNs on Large Clusters},
  author = {Jaeyong Song and Hongsun Jang and Jaewon Jung and Youngsok Kim and Jinho Lee},
  journal= {arXiv preprint arXiv:2311.06837},
  year   = {2024}
}