优化 FPGA 上 CNN 实现的 DSP 块利用率的整体方法
计算机视觉与模式识别
2018-05-29 v1
摘要
深度神经网络正在成为图像理解乃至更广泛的计算机视觉任务的事实标准模型。由于它们涉及高度可并行化的计算,CNN 非常适合当前的细粒度可编程逻辑器件。因此,多种 CNN 加速器已成功在 FPGA 上实现。然而,FPGA 的资源(如逻辑元件或 DSP 单元)仍然有限。本工作提出了一种整体方法,依靠近似计算和设计空间探索来优化 FPGA 上 CNN 实现的 DSP 块利用率。在 Altera Stratix V 器件上实现可重构 OCR 卷积神经网络时对该方法进行了测试,并改变数据表示和 CNN 拓扑,以寻找 DSP 块利用率和分类精度方面的最佳组合。该探索生成了具有 5 种不同定点表示的 76 种 CNN 拓扑的数据流架构。最高效的实现使用 8% 的可用 DSP 块,在 256 x 256 分辨率下每秒执行 883 次分类。
引用
@article{arxiv.1703.09779,
title = {A Holistic Approach for Optimizing DSP Block Utilization of a CNN implementation on FPGA},
author = {Kamel Abdelouahab and Cedric Bourrasset and Maxime Pelcat and François Berry and Jean-Charles Quinton and Jocelyn Serot},
journal= {arXiv preprint arXiv:1703.09779},
year = {2018}
}
备注
8 pages, 6 figures