Hulk: 用于优化区域分布式计算系统的图神经网络
分布式、并行与集群计算
2023-04-14 v2 计算与语言
摘要
大型深度学习模型已在各类应用中展现出提供卓越成果的巨大潜力。然而,由于模型参数量极其庞大(常由数千亿参数组成),训练过程极具挑战。常见的分布式训练方法,如数据并行、张量并行和流水线并行,在整个过程中需要大量数据通信,导致物理距离较远的分布式系统中部分机器等待时间延长。为解决此问题,我们提出一种称为 Hulk 的新方案,利用改进的图神经网络优化分布式计算系统。Hulk 不仅优化不同国家甚至同一城市内不同区域间的数据通信效率,还提供模型并行的最优分布式部署。例如,它可将某些层放置在特定区域的机器上,或将模型的特定参数传递到特定位置的机器。通过在实验中采用 Hulk,我们将分布式系统上大型深度学习模型训练的时间效率提升了 20% 以上。我们的无标签数据开源集合:https://github.com/DLYuanGod/Hulk。
引用
@article{arxiv.2302.13741,
title = {Hulk: Graph Neural Networks for Optimizing Regionally Distributed Computing Systems},
author = {Zhengqing Yuan and Huiwen Xue and Chao Zhang and Yongming Liu},
journal= {arXiv preprint arXiv:2302.13741},
year = {2023}
}
备注
16 pages,10 figures, Accepted by Intelligent Systems Conference(IntelliSys 2023)