中文

受限带宽网络中大型语言模型训练的稳定性增强

机器学习 2024-10-08 v3 人工智能

摘要

训练拥有数十亿参数的极大型语言模型(LLM)是一项计算密集型任务,挑战了当前数据并行训练系统的极限。虽然诸如 ZeRO++ 等技术已使在廉价低带宽集群上对此类巨型模型进行高效分布式训练成为可能,但由于减少跨机器通信所采用的分层分区(hpZ)方案可能存在竞态条件,这些技术仍可能面临收敛问题。在本工作中,我们首先展示了这些竞race条件在训练拥有数十亿参数的模型时导致不稳定现象。随后,我们提出了一种修改分区算法的方法,这种方法解决了这些收敛挑战,同时保持了具竞争力的训练效率。在对齐 Falcon 模型和 Llama-2 模型进行多数十亿参数训练的实证评估中,结果表明,更新后的算法能够在这些大型模型上实现可靠收敛,而原装 ZeRO++ hpZ 无法收敛。该更新算法在不牺牲收敛质量的前提下,实现了 98% 的吞吐量和模型训练速度提升,使更大模型的训练变得稳健可靠。

关键词

引用

@article{arxiv.2407.01614,
  title  = {Enhancing Stability for Large Language Models Training in Constrained Bandwidth Networks},
  author = {Yun Dai and Tejas Dharamsi and Byron Hsu and Tao Song and Hamed Firooz},
  journal= {arXiv preprint arXiv:2407.01614},
  year   = {2024}
}