DistTGL:基于分布式内存的时序图神经网络训练
机器学习
2023-07-18 v1
摘要
基于内存的时序图神经网络是动态图表示学习的有力工具,并在许多真实世界应用中展现出优越性能。然而,其节点内存倾向于更小的批大小以捕获图事件中的更多依赖关系,且需要在所有训练器间同步维护。因此,现有框架在扩展到多个GPU时会出现精度损失。更糟糕的是,同步节点内存的巨大开销使其难以部署到分布式GPU集群。本工作中,我们提出DistTGL——一种在分布式GPU集群上训练基于内存的TGNN的高效可扩展方案。DistTGL相较现有方案有三方面改进:增强的TGNN模型、新颖的训练算法以及优化的系统。实验中,DistTGL实现近线性收敛加速,精度较最先进的单机方法提升14.5%,训练吞吐量提升10.17倍。
引用
@article{arxiv.2307.07649,
title = {DistTGL: Distributed Memory-Based Temporal Graph Neural Network Training},
author = {Hongkuan Zhou and Da Zheng and Xiang Song and George Karypis and Viktor Prasanna},
journal= {arXiv preprint arXiv:2307.07649},
year = {2023}
}
备注
SC'23