FAST:基于可变精度块浮点与随机舍入的DNN训练
机器学习
2021-11-01 v1 硬件体系结构
摘要
块浮点(Block Floating Point, BFP)可通过一组数值共享指数提供宽动态范围,从而高效支持深度神经网络(DNN)训练的量化。在本文中,我们提出了一种用于DNN的快速优先、准确次之训练(FAST)系统,其中权重、激活值和梯度均以BFP表示。FAST支持具有可变精度BFP输入操作数的矩阵乘法,实现训练过程中DNN精度的逐步提升。通过在训练迭代和DNN各层间提升BFP精度,FAST可大幅缩短训练时间,同时减少整体硬件资源使用。我们的FAST乘加器(fMAC)支持多种BFP精度下的点积计算。我们在多个带有不同数据集的DNN上验证了FAST系统,在单芯片平台上相较基于\textbf{混合精度或块}浮点数系统的已有工作实现了2-6的训练加速,同时在验证精度上达到相近性能。
引用
@article{arxiv.2110.15456,
title = {FAST: DNN Training Under Variable Precision Block Floating Point with Stochastic Rounding},
author = {Sai Qian Zhang and Bradley McDanel and H. T. Kung},
journal= {arXiv preprint arXiv:2110.15456},
year = {2021}
}