中文

unzipFPGA:利用即时权重生成增强基于 FPGA 的 CNN 引擎

计算机视觉与模式识别 2021-04-06 v2 硬件体系结构 机器学习

摘要

单一计算引擎已成为基于 FPGA 的卷积神经网络(CNN)的一种流行设计选择,能够在无需重构硬件 fabric 的情况下部署多种模型。然而,这种灵活性常伴随内存受限层上性能的显著下降,以及因某些层在引擎固定配置上映射次优而导致的资源利用不足。本文中,我们研究了一类在运行时引入卷积前阶段以解压权重的模型对 CNN 引擎设计的影响。我们将这些方法称为即时(on-the-fly)方法。为最小化有限带宽对内存受限层的负面影响,我们提出了一种新颖的硬件组件,可实现片上即时权重生成。我们进一步引入了输入选择性处理单元(PE)设计,以在次优映射层上平衡各 PE 间的负载。最后,我们提出 unzipFPGA,一个用于训练即时模型并遍历设计空间以选择性能最高的 CNN 引擎配置的框架。定量评估表明,在受限带宽下,unzipFPGA 相比优化的现状与剪枝 CNN 引擎分别平均加速 2.14 倍和 71%,并且相比最先进的基于 FPGA 的 CNN 加速器最高可实现 3.69 倍更高的性能密度。

关键词

引用

@article{arxiv.2103.05600,
  title  = {unzipFPGA: Enhancing FPGA-based CNN Engines with On-the-Fly Weights Generation},
  author = {Stylianos I. Venieris and Javier Fernandez-Marques and Nicholas D. Lane},
  journal= {arXiv preprint arXiv:2103.05600},
  year   = {2021}
}

备注

Accepted at the 29th IEEE International Symposium on Field-Programmable Custom Computing Machines (FCCM) 2021