中文

分布式基础设施上的模型并行:从理论到大语言模型案例研究的文献综述

分布式、并行与集群计算 2024-03-07 v1 机器学习

摘要

神经网络已成为机器学习的基石。随着这些网络变得越来越复杂的趋势持续下去,用于训练和部署的底层硬件和软件基础设施也是如此。在本综述中,我们回答三个研究问题:“存在哪些类型的模型并行?”、“模型并行的挑战是什么?”以及“模型并行的现代用例是什么?”。我们通过考察神经网络如何被并行化并将其表示为算子图,同时探索可用维度,来回答第一个问题。神经网络可沿其进行并行的维度包括算子内(intra-operator)和算子间(inter-operator)。我们通过收集并列出各类并行的实现挑战,以及最优划分算子图的问题,来回答第二个问题。我们通过收集并列出并行性如何在现代数十亿参数的 Transformer 网络中应用(在关于这些网络的有限信息共享所允许的范围内),来回答最后一个问题。

关键词

引用

@article{arxiv.2403.03699,
  title  = {Model Parallelism on Distributed Infrastructure: A Literature Review from Theory to LLM Case-Studies},
  author = {Felix Brakel and Uraz Odyurt and Ana-Lucia Varbanescu},
  journal= {arXiv preprint arXiv:2403.03699},
  year   = {2024}
}