中文

GPU 上分布式 GNN 训练的特征刻画与理解

分布式、并行与集群计算 2022-04-19 v1 机器学习

摘要

图神经网络(GNN)因其在图上的学习能力有效,已被证明是许多领域中的强大模型。为扩展大图上的 GNN 训练,一种广泛采用的方法是使用多个计算节点加速训练的分布式训练。最大化性能至关重要,但分布式 GNN 训练的执行仍仅被初步理解。本工作中,我们对 GPU 上的分布式 GNN 训练提供深入分析,揭示若干重要现象,并为软件优化与硬件优化提供有用指南。

关键词

引用

@article{arxiv.2204.08150,
  title  = {Characterizing and Understanding Distributed GNN Training on GPUs},
  author = {Haiyang Lin and Mingyu Yan and Xiaocheng Yang and Mo Zou and Wenming Li and Xiaochun Ye and Dongrui Fan},
  journal= {arXiv preprint arXiv:2204.08150},
  year   = {2022}
}

备注

To Appear in IEEE Computer Architecture Letters (CAL) 2022