用于混合精度训练的自适应损失缩放
机器学习
2019-10-29 v1 机器学习
摘要
混合精度训练(MPT)正成为一种实用技术,通过利用现有 GPU 中可用的 IEEE 半精度浮点的快速硬件支持,来提高深度神经网络训练的速度与能效。MPT 通常与一种称为损失缩放的技术结合使用,该方法通过在反向传播开始前放大损失值,以最小化数值下溢对训练的影响。遗憾的是,现有方法将该损失缩放值设为需按模型调优的超参数,且单一缩放值无法适应不同训练阶段的不同层。我们引入一种基于损失缩放的训练方法,称为自适应损失缩放,通过消除调优特定模型损失缩放超参数的需要,使 MPT 更易用且更实用。我们通过引入逐层损失缩放值实现这一点,这些值在训练过程中自动计算,比现有方法更有效地处理下溢。我们给出了在多种网络与任务上的实验结果,表明与现有最先进的 MPT 和单精度浮点相比,我们的方法能缩短收敛时间并提高精度。
引用
@article{arxiv.1910.12385,
title = {Adaptive Loss Scaling for Mixed Precision Training},
author = {Ruizhe Zhao and Brian Vogel and Tanvir Ahmed},
journal= {arXiv preprint arXiv:1910.12385},
year = {2019}
}