中文

MixGCN:基于并行混合和加速器混合的可扩展 GCN 训练

机器学习 2025-02-26 v3 人工智能

摘要

图卷积网络(GCN)在图基学习任务中展现出优势。然而,在完整图上训练 GCN 面临两个挑战:(1)相关特征张量容易使内存爆炸并阻碔现代加速器的通信带宽;(2)训练 GCN 的计算工作流程在稀疏和稠密矩阵运算之间交替, complicating 有效利用计算资源的效率。现有可扩展分布式完整图 GCN 训练解决方案大多采用分区并行,此方案不足以仅部分解决第一个挑战,同时会产生扩大后的通信量。为此,我们提出 MixGCN 以同时应对上述两个挑战。为解决第一个挑战,MixGCN 集成了并行混合。理论和实证分析验证了其恒定通信量和增强的均衡负载;针对第二个挑战,我们考虑加速器混合(即稀疏和稠密加速器),并配备用于 GCN 训练的专用加速器和细粒度流水线。大量实验表明,MixGCN 实现了训练效率和可扩展性的提升。

关键词

引用

@article{arxiv.2501.01951,
  title  = {MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators},
  author = {Cheng Wan and Runkai Tao and Zheng Du and Yang Katie Zhao and Yingyan Celine Lin},
  journal= {arXiv preprint arXiv:2501.01951},
  year   = {2025}
}

备注

15 pages, 12 figures, 5 tables