中文

基于高层次综合的低功耗FPGA残差神经网络加速器设计与优化

硬件体系结构 2023-11-03 v2 信号处理

摘要

残差神经网络在计算机视觉任务中被广泛使用。它们通过缓解梯度消失问题,使得构建更深且更精确的模型成为可能。其主要创新是残差块,允许一层的输出绕过一个或多个中间层并加到后续层的输出上。其复杂的结构以及残差块所需的缓冲,使得它们难以在资源受限平台上实现。我们提出一种针对现场可编程门阵列实现深度学习模型的新设计流程,该流程为 ResNet 优化,采用降低缓冲开销的策略以获得资源高效的残差层实现。我们基于高层次综合(HLS)的流程涵盖一套详尽的设计原则与优化策略,以新颖方式利用时间复用与循环合并等标准技术,将 ResNet 模型及潜在其他基于跳跃连接的神经网络架构高效映射到 FPGA。模型权重与激活量化为8位整数,偏置为16位,累加为32位。实验结果在 CIFAR-10 数据集上获得,使用 Xilinx FPGA 在 Ultra96-V2 与 Kria KV260 开发板上通过 HLS 实现 ResNet8 与 ResNet20。相较于 Kria KV260 板上的最优方案,我们的 ResNet20 实现取得 2.88 倍加速,精度提高 0.5% 达到 91.3%,而 ResNet8 精度提升 2.8% 至 88.7%。ResNet8 与 ResNet20 在 Ultra96 板上的吞吐量分别为 12971 FPS 与 3254 FPS,在 Kria KV260 上分别为 30153 FPS 与 7601 FPS。它们在精度、吞吐量与能耗上帕累托主导现有最优方案。

关键词

引用

@article{arxiv.2309.15631,
  title  = {Design and Optimization of Residual Neural Network Accelerators for Low-Power FPGAs Using High-Level Synthesis},
  author = {Filippo Minnella and Teodoro Urso and Mihai T. Lazarescu and Luciano Lavagno},
  journal= {arXiv preprint arXiv:2309.15631},
  year   = {2023}
}