基于缩减字长的深度神经网络推理
机器学习
2018-10-24 v1 人工智能
机器学习
摘要
深度神经网络(DNN)是许多模式识别任务的强大模型,然而其高计算复杂度与内存需求将其局限在高性能计算平台的应用上。本文中,我们提出一种新方法,仅使用低精度整数运算结合二进制移位与截断操作来评估以 32 位浮点(float32)精度训练的 DNN。由于这些操作的硬件实现比高精度浮点计算简单得多,我们的方法可用于专用硬件上的高效 DNN 推理。在 MNIST 上的实验中,我们证明以 float32 训练的 DNN 可用每层中 2 位整数运算辅以少量 float32 计算的组合,或仅用 3 位整数运算结合二进制移位与截断进行评估,而无显著性能下降。
引用
@article{arxiv.1810.09854,
title = {Deep Neural Network inference with reduced word length},
author = {Lukas Mauch and Bin Yang},
journal= {arXiv preprint arXiv:1810.09854},
year = {2018}
}
备注
submitted to ICASSP 2018