中文

DistGNN-MB:基于小批量采样的 x86 分布式大规模图神经网络训练

机器学习 2022-11-14 v1 分布式、并行与集群计算

摘要

使用小批量采样在包含数十亿顶点和边的图上大规模训练图神经网络,面临一个关键挑战:对图和训练样本进行强扩展会导致计算量降低、通信量增加以及潜在的性能损失。DistGNN-MB 采用一种新颖的历史嵌入缓存结合计算-通信重叠来解决这一挑战。在一个由 3rd3^{rd} 代 Intel Xeon Scalable Processors 构成、每路 36 核的 32 节点(64 路)集群上,DistGNN-MB 在 OGBN-Papers100M 上训练 3 层 GraphSAGE 和 GAT 模型至收敛,在 32 个计算节点上每个 epoch 的时间分别为 2 秒和 4.9 秒。在此规模下,DistGNN-MB 训练 GraphSAGE 的速度比广泛使用的 DistDGL 快 5.2 倍。随着计算节点从 2 个扩展到 32 个,DistGNN-MB 训练 GraphSAGE 和 GAT 的速度分别提升了 10 倍和 17.2 倍。

关键词

引用

@article{arxiv.2211.06385,
  title  = {DistGNN-MB: Distributed Large-Scale Graph Neural Network Training on x86 via Minibatch Sampling},
  author = {Md Vasimuddin and Ramanarayan Mohanty and Sanchit Misra and Sasikanth Avancha},
  journal= {arXiv preprint arXiv:2211.06385},
  year   = {2022}
}