ULEEN:一种用于超低能耗边缘神经网络的新型架构
摘要
在低功耗、实时边缘设备上部署 AI 模型,需要能耗、延迟与面积均为首要关切的加速器。该领域实现深度神经网络(DNNs)的方法众多,包括剪枝、量化、压缩与二值神经网络(BNNs),但随着“极端边缘”的出现,对更高效模型的需求已然显现。为满足超低能耗设备的约束,我们提出基于无权重神经网络(WNNs)的模型架构 ULEEN。无权重神经网络是一类利用查表而非算术运算来执行计算的神经模型。消除高能耗的算术运算使 WNNs 在理论上非常适用于边缘推理;然而其历史上一直受困于精度差与内存占用过大。ULEEN 结合了受 BNNs 启发的算法改进与新颖训练策略,在提升精度与缩减模型规模上取得显著进展。我们将 ULEEN 推理加速器的 FPGA 与 ASIC 实现,同边缘优化的 DNN 与 BNN 设备进行比较。在 Xilinx Zynq Z-7045 FPGA 上,我们在 MNIST 数据集上以 0.21 s 延迟与 96.2% 精度实现每秒 14.3 百万次推理(每焦耳 13 百万次推理),而 Xilinx FINN 以 0.31 s 延迟与 95.83% 精度实现每秒 12.3 百万次推理(每焦耳 1.69 百万次推理)。在 45nm ASIC 中,我们以 98.46% 精度实现每焦耳 5.1 百万次推理与每秒 38.5 百万次推理,而量化的 Bit Fusion 模型以 99.35% 精度实现每焦耳 9230 次推理与每秒 19,100 次推理。在我们对更高效边缘设备的探索中,ULEEN 表明 WNNs 值得被纳入考量。
引用
@article{arxiv.2304.10618,
title = {ULEEN: A Novel Architecture for Ultra Low-Energy Edge Neural Networks},
author = {Zachary Susskind and Aman Arora and Igor D. S. Miranda and Alan T. L. Bacellar and Luis A. Q. Villon and Rafael F. Katopodis and Leandro S. de Araujo and Diego L. C. Dutra and Priscila M. V. Lima and Felipe M. G. Franca and Mauricio Breternitz and Lizy K. John},
journal= {arXiv preprint arXiv:2304.10618},
year = {2023}
}
备注
14 pages, 14 figures Portions of this article draw heavily from arXiv:2203.01479, most notably sections 5E and 5F.2