中文

面向低比特宽与硬件适配神经网络的二次幂量化

机器学习 2022-03-11 v1

摘要

在低功耗嵌入式设备上部署深度神经网络以用于实时受限应用,需要优化网络的内存和计算复杂性,通常通过量化权重来实现。现有的大多数工作采用线性量化,这在权重位宽低于 8 时会导致精度显著下降。由于权重的分布通常是非均匀的(大多数权重集中在零附近),其他方法(如对数量化)更为合适,因为它们能更精确地保留权重分布的形状。此外,使用以 2 为底的对数表示可以通过用位移替代乘法来优化运算。本文探索了利用更低比特精度的非线性量化技术,并确定了有利的硬件实现方案。我们开发了量化感知训练算法,允许训练低比特宽的二次幂网络,并在不同任务上取得了与最先进浮点模型相当的精度。我们探索了 PoT 权重编码技术,并研究了三种不同量化方案(均匀、PoT 和加性 PoT (APoT))的 MAC 单元硬件设计,以展示使用所提方法带来的效率提升。最终实验表明,在低比特宽精度下,非均匀量化的性能优于均匀量化,同时 PoT 量化大幅降低了神经网络的计算复杂性。

关键词

引用

@article{arxiv.2203.05025,
  title  = {Power-of-Two Quantization for Low Bitwidth and Hardware Compliant Neural Networks},
  author = {Dominika Przewlocka-Rus and Syed Shakib Sarwar and H. Ekin Sumbul and Yuecheng Li and Barbara De Salvo},
  journal= {arXiv preprint arXiv:2203.05025},
  year   = {2022}
}

备注

TinyML Research Symposium