ReInc:动态图神经网络规模化训练
机器学习
2025-01-28 v1 分布式、并行与集群计算
摘要
动态图神经网络 (DGNN) 因其在交通网络预测、流行病预测和社交网络分析等多种领域的广泛应用而获得了广泛关注。本文提出 ReInc,一个旨在高效可扩展地训练大规模 DGNN 的系统。ReInc 引入了关键创新,利用 DGNN 固有的图神经网络 (GNN) 与循环神经网络 (RNN) 的独特组合。通过复用中间结果并在连续图快照之间增量计算聚合,ReInc 显著提升了计算效率。为支持这些优化,ReInc 集成了一种新颖的两级缓存机制,配合 DGNN 执行工作流程的专用缓存策略。此外,ReInc 通过一种新的分布式训练策略解决了动态图中结构和时间依赖关系的管理挑战。该方法消除了访问远程特征和重新分配中间结果时通信开销的问题。实验结果表明,ReInc 在各种动态 GNN 架构和真实世界图数据集上实现了最先进框架的约一个数量级的加速。
引用
@article{arxiv.2501.15348,
title = {ReInc: Scaling Training of Dynamic Graph Neural Networks},
author = {Mingyu Guan and Saumia Singhal and Taesoo Kim and Anand Padmanabha Iyer},
journal= {arXiv preprint arXiv:2501.15348},
year = {2025}
}