通过权重即时生成缓解CNN引擎中的内存墙效应
机器学习
2023-07-26 v1 硬件体系结构
计算机视觉与模式识别
摘要
卷积神经网络(CNNs)在广泛AI任务中前所未有的准确性导致其被大量部署于移动和嵌入式场景。为追求高性能与高能效推理,人们在基于FPGA的CNN加速器设计上投入了大量研究。在此背景下,单一计算引擎因无需重构硬件即可支持多样CNN模型而成为流行方案。然而,这种灵活性常伴随内存受限层性能显著下降,以及因某些层在引擎固定配置上映射不佳导致的资源利用不足。本工作中,我们研究了一类在运行时引入预卷积阶段以解压权重的模型对CNN引擎设计的影响。我们称这些方法为即时(on-the-fly)。本文提出unzipFPGA,一种抵消现有CNN引擎局限的新型CNN推理系统。该框架包含一种新型CNN硬件架构,其引入权重生成模块以实现片上权重即时生成,缓解有限带宽对内存受限层的负面影响。我们进一步以自动化硬件感知方法增强unzipFPGA,将权重生成机制适配目标CNN-设备对,从而改善精度-性能平衡。最后,我们提出一种输入选择性处理单元(PE)设计,在次优映射层中平衡PE间负载。该框架产生的硬件设计在相同功耗约束下相较高度优化的GPU设计平均获得2.57倍性能效率提升,并在多种前沿基于FPGA的CNN加速器上实现最高3.94倍更高性能密度。
引用
@article{arxiv.2307.13412,
title = {Mitigating Memory Wall Effects in CNN Engines with On-the-Fly Weights Generation},
author = {Stylianos I. Venieris and Javier Fernandez-Marques and Nicholas D. Lane},
journal= {arXiv preprint arXiv:2307.13412},
year = {2023}
}
备注
Accepted at ACM TODAES, 2023. arXiv admin note: substantial text overlap with arXiv:2103.05600