CNN-MERP:一种用于卷积神经网络正向与反向传播的基于 FPGA 的高内存效率可重构处理器
机器学习
2017-03-23 v1 硬件体系结构
摘要
大规模深度卷积神经网络(CNN)广泛应用于机器学习应用中。尽管 CNN 涉及巨大的复杂性,但提供计算资源高密度集成的 VLSI(ASIC 和 FPGA)芯片被认为是实现 CNN 的有前途的平台。然而,在计算单元的大规模并行下,受 VLSI 芯片引脚数限制的外部存储器带宽成为系统瓶颈。此外,VLSI 解决方案通常被认为缺乏针对 CNN 各种参数进行重新配置的灵活性。本文提出 CNN-MERP 以解决这些问题。CNN-MERP 包含一个高效的存储层次结构,该结构通过包括片上/片外数据分配、数据流优化和数据重用在内的多重优化,显著降低了带宽需求。所提出的两级可重构性用于实现快速高效的重配置,这基于 FPGA 的控制逻辑和多启动特性。最终,实现了 1.94MB/GFlop 的外部存储器带宽需求,比先前技术低 55%。在有限的 DRAM 带宽下,在 Vertex UltraScale 平台上实现了 1244GFlop/s 的系统吞吐量,比现有最先进的 FPGA 实现高 5.48 倍。
引用
@article{arxiv.1703.07348,
title = {CNN-MERP: An FPGA-Based Memory-Efficient Reconfigurable Processor for Forward and Backward Propagation of Convolutional Neural Networks},
author = {Xushen Han and Dajiang Zhou and Shihao Wang and Shinji Kimura},
journal= {arXiv preprint arXiv:1703.07348},
year = {2017}
}