中文

利用低位宽累加器实现深度网络的更低成本推理

机器学习 2024-01-26 v1 人工智能 硬件体系结构

摘要

目前,关于深度神经网络(DNN)量化的研究大多集中于降低高层框架可见的张量(如权重、激活值和梯度)的精度。然而,当前的硬件仍然依赖于高精度的核心运算,其中最重要的是乘积累加操作。这种高精度累加操作正逐渐成为主要的计算瓶颈。这是因为迄今为止,使用低精度累加器会导致性能显著下降。在这项工作中,我们提出了一种简单的方法来训练和微调高端DNN,首次允许使用更便宜的12位累加器,且精度没有显著下降。最后,我们表明,随着我们进一步降低累加精度,使用细粒度梯度近似可以提高DNN的精度。

关键词

引用

@article{arxiv.2401.14110,
  title  = {Towards Cheaper Inference in Deep Networks with Lower Bit-Width Accumulators},
  author = {Yaniv Blumenfeld and Itay Hubara and Daniel Soudry},
  journal= {arXiv preprint arXiv:2401.14110},
  year   = {2024}
}