Collage:面向LLM训练的轻量级低精度策略
机器学习
2024-05-07 v1
摘要
大模型训练受到高昂计算成本和有限硬件内存的困扰。一个实用的解决方案是低精度表示,但存在数值精度损失和训练不稳定导致模型效果下降的问题。我们认为,只要在训练过程中的关键位置适当补偿误差,低精度浮点数可以表现良好。我们提出了Collage,它利用低精度下的多分量浮点表示来精确执行操作,同时考虑数值误差。为了理解不精确性对训练的影响,我们提出了一种简单而新颖的度量,该度量跟踪训练过程中丢失的信息,并区分不同的精度策略。我们的方法适用于常用的低精度格式,如半精度(16位浮点数),并且可以自然地扩展到更低精度,如8位。实验结果表明,使用Collage进行预训练消除了使用32位浮点数模型副本的需求,并且与(16, 32)位混合精度策略相比,达到了相似或更好的训练性能,实际中实现了高达3.7倍的加速和约15%至23%的内存节省。
引用
@article{arxiv.2405.03637,
title = {Collage: Light-Weight Low-Precision Strategy for LLM Training},
author = {Tao Yu and Gaurav Gupta and Karthick Gopalswamy and Amith Mamidala and Hao Zhou and Jeffrey Huynh and Youngsuk Park and Ron Diamant and Anoop Deoras and Luke Huan},
journal= {arXiv preprint arXiv:2405.03637},
year = {2024}
}
备注
ICML 2024