到FP8及返回:量化LLM训练稳定性中的低精度效应
机器学习
2025-03-26 v2 人工智能
摘要
大型语言模型(LLM)预训练的巨大计算成本已推动广泛采用低精度浮点表示以加速该过程。因此,脑浮点16位(BrainFloat16, BF16)精度已成为LLM训练的事实标准,近期一代加速器已内置该支持。最新处理器进一步推进,其中FP8精度近期被引入。然而,针对FP16的先前经验显示其不如BF16稳定,这引发了疑虑:FP8是否由于位数甚至少于FP16,仍可作为经济实惠的LLM训练选项。我们认为,低精度训练方案必须在训练稳定性和超参数敏感性方面与其高精度对应版本相似,才能具备成本效益。然而,我们发现当前可用的FP8训练方法不够稳健,无法作为经济实惠替代方案。这促使我们深入研究LLM低精度训练的稳定性,关注其在随机种子、学习率和数据集方面的鲁棒性。为此,我们提出了新的评估技术和一种用于量化自回归语言模型损失景观锐度的新指标。通过模拟浮点表示中逐步减小的位数,我们分析了表示能力与训练稳定性之间的关系,旨在为该领域的后续研究提供帮助。
引用
@article{arxiv.2405.18710,
title = {To FP8 and Back Again: Quantifying Reduced Precision Effects on LLM Training Stability},
author = {Joonhyung Lee and Jeongin Bae and Byeongwook Kim and Se Jung Kwon and Dongsoo Lee},
journal= {arXiv preprint arXiv:2405.18710},
year = {2025}
}