面向受限边缘节点 DNN 推理的通道级混合精度分配
机器学习
2023-01-26 v2
摘要
量化被广泛用于云和边缘系统,以减少深度神经网络的内存占用、延迟和能耗。特别是混合精度量化,即网络不同部分使用不同位宽,已被证明能以有限的精度下降提供优异的效率增益,尤其是在由自动化神经架构搜索(NAS)工具确定的优化位宽分配下。最先进的混合精度工作以层为单位,即对每个网络层的权重和激活张量使用不同位宽。在本工作中,我们拓宽搜索空间,提出一种新颖的 NAS,独立选择每个权重张量通道的位宽。这使工具具备额外灵活性,仅对与最具信息量特征相关的权重分配更高精度。在 MLPerf Tiny 基准套件上测试,我们在精度-模型大小和精度-能量空间中获得了丰富的帕累托最优模型集合。当部署于 MPIC RISC-V 边缘处理器时,在同等精度下,我们的网络相比层级方法分别将推理内存和能耗降低至多 63% 和 27%。
引用
@article{arxiv.2206.08852,
title = {Channel-wise Mixed-precision Assignment for DNN Inference on Constrained Edge Nodes},
author = {Matteo Risso and Alessio Burrello and Luca Benini and Enrico Macii and Massimo Poncino and Daniele Jahier Pagliari},
journal= {arXiv preprint arXiv:2206.08852},
year = {2023}
}