单元缩放:开箱即用的低精度训练
机器学习
2023-06-01 v2
摘要
我们提出单元缩放(unit scaling),一种简化低精度数格式使用的深度学习模型设计范式。在FP16或近期提出的FP8格式中训练可带来显著的效率提升,但可能缺乏开箱训练所需的足够范围。单元缩放通过引入一种有原则的模型数值方法解决此问题:在初始化时寻求所有权重、激活与梯度的单位方差。与替代方法不同,该方法既不需要多次训练运行以寻找合适尺度,也没有显著的计算开销。我们展示了单元缩放在一系列模型与优化器上的有效性。我们进一步表明现有模型可被改造为单元缩放,以FP16而后FP8训练BERT-Large而无精度下降。
引用
@article{arxiv.2303.11257,
title = {Unit Scaling: Out-of-the-Box Low-Precision Training},
author = {Charlie Blake and Douglas Orr and Carlo Luschi},
journal= {arXiv preprint arXiv:2303.11257},
year = {2023}
}
备注
29 pages, 11 figures