改善地域分布式语言模型训练中的训练时间和 GPU 利用率
机器学习
2024-11-25 v1
摘要
语言模型(LM)的广泛采用导致 GPU 需求激增。训练大型 LM 需要数万块 GPU,且将其集中在同一数据中心(DC)面临诸多约束,包括峰值电力供应的可用性。我们专注于通过宽域网络(WAN)连接的多个 DC 之间进行训练。我们构建了 Atlas,通过创新的工作负载感知的时序带宽共享等设计选择加快训练速度。尽管 Atlas 改进了训练时间,但未能完全消除气泡(空闲 GPU 周期)。我们构建了 BubbleTea,在气泡期间运行预填即服务(LM 推理的一部分),从而在不影响训练的情况下提高 GPU 利用率。与最先进的设计相比,Atlas 和 BubbleTea 联合实现了最高可达 17 倍的训练加速,GPU 利用率达到 94%。该代码将开源。
引用
@article{arxiv.2411.14457,
title = {Guiding Reinforcement Learning Using Uncertainty-Aware Large Language Models},
author = {Maryam Shoaeinaeini and Brent Harrison},
journal= {arXiv preprint arXiv:2411.14457},
year = {2024}
}
备注
8 pages, 7 figures