GPU 上分布式 GNN 训练的特征刻画与理解
分布式、并行与集群计算
2022-04-19 v1 机器学习
摘要
图神经网络(GNN)因其在图上的学习能力有效,已被证明是许多领域中的强大模型。为扩展大图上的 GNN 训练,一种广泛采用的方法是使用多个计算节点加速训练的分布式训练。最大化性能至关重要,但分布式 GNN 训练的执行仍仅被初步理解。本工作中,我们对 GPU 上的分布式 GNN 训练提供深入分析,揭示若干重要现象,并为软件优化与硬件优化提供有用指南。
引用
@article{arxiv.2204.08150,
title = {Characterizing and Understanding Distributed GNN Training on GPUs},
author = {Haiyang Lin and Mingyu Yan and Xiaocheng Yang and Mo Zou and Wenming Li and Xiaochun Ye and Dongrui Fan},
journal= {arXiv preprint arXiv:2204.08150},
year = {2022}
}
备注
To Appear in IEEE Computer Architecture Letters (CAL) 2022