大型语言模型的低精度训练:方法、挑战与机遇
机器学习
2025-05-05 v1 人工智能
摘要
大型语言模型(LLMs)已在众多领域取得了令人瞩目的性能。然而,其训练所需的大量硬件资源对效率和可扩展性构成了显著障碍。为缓解这一挑战,低精度训练技术已被广泛采用,从而在训练效率方面取得了显著进步。尽管有这些收益,低精度训练涉及多个组成部分——如权重、激活值和梯度——每个部分都可以用不同的数值格式表示。由此产生的多样性造成了低精度训练研究的碎片化格局,使得研究人员难以获得对该领域的统一概览。本综述对现有的低精度训练方法进行了全面回顾。为了系统地组织这些方法,我们根据其底层数值格式将它们分为三个主要类别,这是影响硬件兼容性、计算效率以及便于读者参考的关键因素。这些类别是:(1)基于定点数和整数的方法,(2)基于浮点数的方法,以及(3)基于自定义格式的方法。此外,我们讨论了量化感知训练方法,这些方法在前向传播过程中与低精度训练具有关键的相似性。最后,我们指出了几个有前景的研究方向以推动该领域发展。本综述所讨论的论文合集可在 https://github.com/Hao840/Awesome-Low-Precision-Training 获取。
引用
@article{arxiv.2505.01043,
title = {Low-Precision Training of Large Language Models: Methods, Challenges, and Opportunities},
author = {Zhiwei Hao and Jianyuan Guo and Li Shen and Yong Luo and Han Hu and Guoxia Wang and Dianhai Yu and Yonggang Wen and Dacheng Tao},
journal= {arXiv preprint arXiv:2505.01043},
year = {2025}
}