SDT-GNN:面向图神经网络的基于流式处理的分布式训练框架
机器学习
2025-12-09 v2 分布式、并行与集群计算
摘要
近年来,诸如DistDGL和PyG之类的分布式GNN训练框架已被开发出来,通过以分布式方式利用多个GPU来实现在大图上训练GNN模型。尽管取得了这些进展,但它们的内存需求仍然过高,从而阻碍了在商用工作站上对大图进行GNN训练。在本文中,我们提出了SDT-GNN,一个基于流式处理的分布式GNN训练框架。与将整个图加载到内存中的现有框架不同,它采用边流作为图划分的输入,以降低划分的内存需求。它还能在GPU聚合内存大小小于图和特征数据大小的情况下实现分布式GNN训练。此外,为了提高划分质量,我们提出了SPRING,一种用于分布式GNN训练的新型流式划分算法。我们在七个大型公开数据集上展示了SDT-GNN的有效性和效率。与DistDGL和PyG相比,SDT-GNN在不牺牲预测精度的情况下,内存占用最多减少95%。SPRING也显著优于最先进的流式划分算法。
引用
@article{arxiv.2404.02300,
title = {SDT-GNN: Streaming-based Distributed Training Framework for Graph Neural Networks},
author = {Xin Huang and Weipeng Zhuo and Minh Phu Vuong and Shiju Li and Jongryool Kim and Bradley Rees and Chul-Ho Lee},
journal= {arXiv preprint arXiv:2404.02300},
year = {2025}
}
备注
IEEE BigData 2025