中文

Baechi:机器学习图的高效设备放置

分布式、并行与集群计算 2023-01-23 v1 机器学习

摘要

当设备内存有限或模型规模庞大时,机器学习图(或模型)的训练可能极具挑战甚至无法完成。为了将模型切分到多个设备上,基于学习的方法依然流行。尽管这些方法产生的模型放置方案在数据上训练速度快(即步时间短),但基于学习的模型并行耗时严重,往往需要数小时乃至数天才能生成算子到设备的放置方案。我们提出 Baechi 系统,这是首个采用算法方法解决在内存受限设备小集群上运行机器学习训练图放置问题的系统。我们将 Baechi 的实现集成到两个流行的开源学习框架中:TensorFlow 和 PyTorch。使用 GPU 的实验结果表明:(i) Baechi 生成放置方案的速度比最先进的基于学习的方法快 654 倍至 206K 倍;(ii) Baechi 放置模型的步(训练)时间与 PyTorch 中的专家放置相当,且仅比 TensorFlow 中的专家放置差至多 6.2%。我们从数学上证明,我们的两种算法与最优解的差距在常数因子之内。我们的工作表明,与基于学习的方法相比,算法方法在适应机器学习系统时面临不同的挑战,但同时也提供了可证明的界和显著的性能优势。

关键词

引用

@article{arxiv.2301.08695,
  title  = {Baechi: Fast Device Placement of Machine Learning Graphs},
  author = {Beomyeol Jeon and Linda Cai and Chirag Shetty and Pallavi Srivastava and Jintao Jiang and Xiaolan Ke and Yitao Meng and Cong Xie and Indranil Gupta},
  journal= {arXiv preprint arXiv:2301.08695},
  year   = {2023}
}

备注

Extended version of SoCC 2020 paper: https://dl.acm.org/doi/10.1145/3419111.3421302