有限精度下深度神经网络的训练
神经与进化计算
2018-10-15 v1
摘要
DNN 的节能与资源高效训练将极大拓展深度学习的应用。然而,有三个主要障碍要求以高精度进行准确计算。本文中,我们解决了其中两个与低精度训练中参数更新时梯度丢失以及通过 softmax 非线性层的反向传播相关的问题。我们通过采用额外参数以虚拟扩展参数的位宽,实现了带 Kahan 求和的 SGD,从而实现可靠参数更新。我们还提出了一条简单准则,以帮助为后接 softmax 非线性层的最后一个全连接层选择合适的位宽。该准则基于数据集的类别规模确定所需位宽的下界。在各种网络架构与基准上的大量实验验证了所提低精度训练技术的有效性。
引用
@article{arxiv.1810.05486,
title = {Training Deep Neural Network in Limited Precision},
author = {Hyunsun Park and Jun Haeng Lee and Youngmin Oh and Sangwon Ha and Seungwon Lee},
journal= {arXiv preprint arXiv:1810.05486},
year = {2018}
}