中文

GIST:面向大规模图卷积网络的分布式训练

机器学习 2022-03-15 v4 人工智能 分布式、并行与集群计算 最优化与控制

摘要

图卷积网络(GCN)是图机器学习的首选方案,但其训练在图规模和模型参数量两方面都 notoriously 难以扩展。尽管已有工作探索了大规模图上的训练(如 GraphSAGE、ClusterGCN 等),我们提出了一种新颖的分布式训练框架,开创了大规模 GCN 模型(即超宽、过参数化模型)的高效训练。我们提出的称为 GIST 的训练方法,将 GCN 模型的参数不相交地划分为若干更小的子 GCN,这些子 GCN 独立且并行地训练。除了兼容所有 GCN 架构和现有用于高效 GCN 训练的采样技术外,GIST 还 i) 提升模型性能,ii) 可扩展至任意大图的训练,iii) 减少挂钟训练时间,iv) 支持显著过参数化 GCN 模型的训练。值得注意的是,借助 GIST,我们训练了一个惊人地宽的 32,768 维 GraphSAGE 模型,其规模超出单 GPU 容量 8 倍,并在 Amazon2M 数据集上达到 SOTA 性能。

关键词

引用

@article{arxiv.2102.10424,
  title  = {GIST: Distributed Training for Large-Scale Graph Convolutional Networks},
  author = {Cameron R. Wolfe and Jingkang Yang and Arindam Chowdhury and Chen Dun and Artun Bayer and Santiago Segarra and Anastasios Kyrillidis},
  journal= {arXiv preprint arXiv:2102.10424},
  year   = {2022}
}

备注

28 pages, 5 figures, pre-print under review