用于深度神经网络低精度训练的移位压缩8位浮点格式
机器学习
2020-01-17 v1
摘要
使用更多参数同时保持快速迭代是开发性能更优的深度神经网络(DNN)模型日益采用的策略和趋势。这需要增加训练的内存占用和计算需求。在此我们介绍一种使用8位浮点(FP8)数训练深度神经网络的新方法。降低位精度可带来更大的有效内存和更高的计算速度。我们将此方法命名为移位压缩FP8(S2FP8)。我们表明,与以往的8位精度训练方法不同,所提方法可开箱即用地用于代表性模型:ResNet-50、Transformer和NCF。该方法能够保持模型精度,而无需微调损失缩放参数或将某些层保持在单精度。我们引入了DNN张量的两个可学习统计量——移位因子和压缩因子,用于最优地调整张量在8位中的范围,从而最小化因量化导致的信息损失。
引用
@article{arxiv.2001.05674,
title = {Shifted and Squeezed 8-bit Floating Point format for Low-Precision Training of Deep Neural Networks},
author = {Léopold Cambier and Anahita Bhiwandiwalla and Ting Gong and Mehran Nekuii and Oguz H Elibol and Hanlin Tang},
journal= {arXiv preprint arXiv:2001.05674},
year = {2020}
}