中文

Morphling:大规模图神经网络训练的快速、融合且灵活的实现

机器学习 2026-05-27 v5 分布式、并行与集群计算 编程语言

摘要

图神经网络(GNN)通过将不规则的、内存受限的图遍历与规整的、计算密集型稠密矩阵运算融合,呈现出根本性的硬件挑战。虽然PyTorch Geometric(PyG)和Deep Graph Library(DGL)等框架侧重于高级可用性,但它们未能解决这些差异化的执行特征。结果,它们依赖通用内核,导致缓存局部性差、内存移动过度以及中间分配大。为解决这些限制,我们提出了Morphling——一个专门的域代码合成器,以弥补这一差距。Morphling将高级GNN规范编译为针对OpenMP、CUDA和MPI的可移植、后端专用实现。它通过实例化针对每个执行环境的优化、体系结构感知原始语义库来实现这一点。Morphling还集成了一个基于稀疏性的运行时执行引擎,能够动态选择稠密或稀疏执行路径,依据输入特征统计信息,减少对零值条目的不必要计算。我们在覆盖多样图结构、特征维度和稀疏性 regimes 的十一个真实数据集上对Morphling进行评估。相较于PyG和DGL,Morphling在CPU上实现平均20X的每代训练吞吐量提升,在GPU上实现19X,在分布式设置中实现6X,最高可达66X的加速。Morphling的内存高效布局进一步将峰值内存消耗降低最高可达15X,使大规模GNN训练在常规硬件上成为可能。这些发现表明,专门的、面向体系结构的代码合成为跨越多种并行和分布式平台的高性能GNN执行提供了有效且可扩展的路径。

关键词

引用

@article{arxiv.2512.01678,
  title  = {Morphling: Fast, Fused, and Flexible GNN Training at Scale},
  author = {Anubhab and Rupesh Nasre},
  journal= {arXiv preprint arXiv:2512.01678},
  year   = {2026}
}