使用动态定点数的混合低精度深度学习推理
机器学习
2017-02-02 v2 神经与进化计算
摘要
我们提出一种基于簇的量化方法,将预训练的全精度权重转换为三值权重,对精度影响最小。此外,我们还将激活值限制为8位,从而启用低于8位的全整数推理流水线。我们的方法使用具有公共缩放因子的N个滤波器的小簇,以最小化量化损失,同时最大化三值运算的数量。我们展示,在Resnet-101上采用簇大小N=4,可实现71.8%的TOP-1准确率,与最佳全精度结果相差6%以内,同时将约85%的乘法替换为8位累加。使用相同方法配合4位权重可实现76.3%的TOP-1准确率,与全精度结果相差2%以内。我们还研究了簇大小对性能和准确率的影响,较大的簇大小N=64可将约98%的乘法替换为三值运算,但会引入准确率的显著下降,这需要通过以更低精度重新训练网络来微调参数。为此,我们还通过用全精度权重预初始化网络,训练了具有8位激活和三值权重的低精度Resnet-50,并在额外4个周期内达到68.9%的TOP-1准确率。我们最终的量化模型可运行在完整的8位计算流水线上,与基线全精度模型相比潜在性能提升16倍。
引用
@article{arxiv.1701.08978,
title = {Mixed Low-precision Deep Learning Inference using Dynamic Fixed Point},
author = {Naveen Mellempudi and Abhisek Kundu and Dipankar Das and Dheevatsa Mudigere and Bharat Kaul},
journal= {arXiv preprint arXiv:1701.08978},
year = {2017}
}