中文

改善地域分布式语言模型训练中的训练时间和 GPU 利用率

机器学习 2024-11-25 v1

摘要

语言模型(LM)的广泛采用导致 GPU 需求激增。训练大型 LM 需要数万块 GPU,且将其集中在同一数据中心(DC)面临诸多约束,包括峰值电力供应的可用性。我们专注于通过宽域网络(WAN)连接的多个 DC 之间进行训练。我们构建了 Atlas,通过创新的工作负载感知的时序带宽共享等设计选择加快训练速度。尽管 Atlas 改进了训练时间,但未能完全消除气泡(空闲 GPU 周期)。我们构建了 BubbleTea,在气泡期间运行预填即服务(LM 推理的一部分),从而在不影响训练的情况下提高 GPU 利用率。与最先进的设计相比,Atlas 和 BubbleTea 联合实现了最高可达 17 倍的训练加速,GPU 利用率达到 94%。该代码将开源。

关键词

引用

@article{arxiv.2411.14457,
  title  = {Guiding Reinforcement Learning Using Uncertainty-Aware Large Language Models},
  author = {Maryam Shoaeinaeini and Brent Harrison},
  journal= {arXiv preprint arXiv:2411.14457},
  year   = {2024}
}

备注

8 pages, 7 figures