PipeFisher:利用流水线与 Fisher 信息矩阵高效训练大语言模型
机器学习
2023-05-16 v2
摘要
流水线并行能够在大规模分布式加速器集群上高效训练大语言模型(LLMs)。然而,启动和结束阶段的流水线气泡降低了加速器的利用率。尽管已提出具有微批处理和双向流水线的有效流水线方案以最大化利用率,但大量气泡无法通过同步前向和反向传播填补。为解决该问题,我们建议将额外工作分配给气泡,以在 LLM 训练中获得辅助收益。作为该方向的一个示例,我们提出 PipeFisher,它将基于 Fisher 信息矩阵的二阶优化方法 K-FAC 的工作分配给气泡以加速收敛。在 BERT-Base 和 BERT-Large 模型的阶段 1 预训练中,PipeFisher 通过大幅提升加速器利用率并受益于 K-FAC 带来的改进收敛,将(模拟)训练时间缩短至使用一阶优化器的 50-75%。
引用
@article{arxiv.2211.14133,
title = {PipeFisher: Efficient Training of Large Language Models Using Pipelining and Fisher Information Matrices},
author = {Kazuki Osawa and Shigang Li and Torsten Hoefler},
journal= {arXiv preprint arXiv:2211.14133},
year = {2023}
}
备注
MLSys 2023