中文

Dorylus:利用分布式 CPU 服务器与无服务器线程实现经济、可扩展且准确的 GNN 训练

分布式、并行与集群计算 2021-05-26 v2 机器学习

摘要

图神经网络(GNN)使得在结构化图数据上进行深度学习成为可能。GNN 训练存在两大主要障碍:1)它依赖配备多块 GPU 的高端服务器,这类服务器购买与维护成本高昂;2)GPU 有限的内存无法扩展到当今十亿边规模的图。本文提出 Dorylus:一个用于训练 GNN 的分布式系统。独特之处在于,Dorylus 能够利用无服务器计算以低成本提升可扩展性。指导我们设计的核心洞见是计算分离。计算分离使得构建深度、有界异步流水线成为可能,其中图并行与张量并行任务可完全重叠,有效隐藏了 Lambda 带来的网络延迟。在数千个 Lambda 线程的协助下,Dorylus 将 GNN 训练扩展到十亿边图。目前,对于大图而言,CPU 服务器相比 GPU 服务器具有最佳的每美元性能。仅在 CPU 服务器之上使用 Lambda,相比仅用 CPU 服务器训练可提供高达 2.75 倍的每美元性能。具体而言,对于大规模稀疏图,Dorylus 比 GPU 服务器快 1.22 倍且便宜 4.83 倍。与现有基于采样的系统相比,Dorylus 最高快 3.8 倍且便宜 10.7 倍。

关键词

引用

@article{arxiv.2105.11118,
  title  = {Dorylus: Affordable, Scalable, and Accurate GNN Training with Distributed CPU Servers and Serverless Threads},
  author = {John Thorpe and Yifan Qiao and Jonathan Eyolfson and Shen Teng and Guanzhou Hu and Zhihao Jia and Jinliang Wei and Keval Vora and Ravi Netravali and Miryung Kim and Guoqing Harry Xu},
  journal= {arXiv preprint arXiv:2105.11118},
  year   = {2021}
}

备注

Paper accepted in OSDI 2021