中文

平衡速度与稳定性:LLM训练中FP8与BF16的权衡

机器学习 2024-11-14 v1

摘要

大型语言模型(LLM)因其类似人类语言理解和生成能力以及跨领域的适用性而备受关注。这些模型以其庞大的规模和广泛的训练数据为特征,不断推动自然语言处理的可能性边界。例如,Llama 3系列以其旗舰模型为例,该模型拥有4050亿个参数,在15.6万亿个token上训练。训练此类模型所需的巨大计算需求激发了持续的研究,旨在优化训练过程的效率,特别是通过使用低精度格式。NVIDIA的H100 GPU除了支持更传统的FP16和BF16格式外,还引入了对FP8的支持,已成为这一优化工作的焦点。初步研究表明,与BF16相比,FP8可以在不牺牲模型性能的情况下大幅减少训练时间,使其成为大规模模型训练的有希望的候选者。然而,采用FP8的更广泛影响,特别是在训练稳定性和下游任务性能方面,尚未完全了解。在本研究中,我们深入探讨了在训练LLM时采用FP8而非BF16所涉及的实际权衡。

关键词

引用

@article{arxiv.2411.08719,
  title  = {Balancing Speed and Stability: The Trade-offs of FP8 vs. BF16 Training in LLMs},
  author = {Kazuki Fujii and Taishi Nakamura and Rio Yokota},
  journal= {arXiv preprint arXiv:2411.08719},
  year   = {2024}
}

备注

2 pages,extended abstract