FPGA 上高吞吐混合精度 CNN 加速器设计
硬件体系结构
2022-08-10 v1 人工智能
机器学习
摘要
卷积神经网络(CNNs)在各应用域中达到高准确率,但需要大量计算并带来昂贵的数据搬移。在牺牲一定准确率的前提下降低这些开销的一种方法是缩减权重和/或激活值的字长。其中,逐层混合精度量化可在膨胀设计空间的同时获得更高效的结果。本工作中,我们提出一种深入的定量方法,以在考虑给定 FPGA 有限硬件资源的情况下高效探索设计空间。我们的整体探索方法纵向穿越从架构层到逻辑层的各类设计入口层级,横向覆盖从处理单元到数据流的优化,以构建高效的混合精度 CNN 加速器。我们所得的硬件加速器实现了真正的混合精度运算,能够高效执行逐层与逐通道量化的 CNN。映射前馈与恒等快捷连接混合精度 CNN 分别得到具竞争力的准确率-吞吐权衡:ResNet-18 达 245 帧/秒、Top-5 准确率 87.48%,ResNet-152 达 Top-5 准确率 92.9%、1.13 TOps/s。据此,参数量所需内存占用较各自浮点基线分别减少 4.9 倍与 9.4 倍。
引用
@article{arxiv.2208.04854,
title = {Design of High-Throughput Mixed-Precision CNN Accelerators on FPGA},
author = {Cecilia Latotzke and Tim Ciesielski and Tobias Gemmeke},
journal= {arXiv preprint arXiv:2208.04854},
year = {2022}
}
备注
32nd International Conference on Field Programmable Logic and Applications (FPL 2022)