中文

DYNAMAP:面向低延迟CNN推理的动态算法映射框架

分布式、并行与集群计算 2021-03-16 v2

摘要

现有大多数关于卷积神经网络(CNN)的FPGA加速工作都聚焦于在所有层上采用单一策略(算法、数据流等)。这种方法在复杂且深度的CNN上无法达到最优延迟。新兴的CNN具有多样的逐层计算特征,包括并行度、算术强度、局部性与内存占用。为实现低的端到端延迟,需要进行逐层策略选择与细粒度调优。然而,专用于每一层的专用硬件模块限制了逐层利用率,并对端到端延迟产生不利影响。本文通过一种算法-架构协同优化框架DYNAMAP解决这些问题,该框架包含:(1)一个可在各层间复用的统一硬件覆盖层,支持所有三类主流卷积算法的动态映射,并进一步允许灵活的数据流切换以最大化每层的硬件利用率;(2)一种新颖的软件设计空间探索(DSE)流程,用于定制硬件覆盖层并选择最优策略映射。我们展示了算法映射空间随网络深度呈指数增长,且尽管最优算法选择问题在一般情形下是NP难的,但通过利用CNN模型的串并行结构,我们给出了一种多项式时间的最优算法映射解法。DYNAMAP针对任意CNN进行了优化,包括那些各层间具有不同计算与内存需求的CNN。我们使用两种最先进的CNN——GoogleNet与Inception-V4——展示了DYNAMAP。所生成的加速器相较于最先进的FPGA实现,在推理延迟上分别实现了高达2.8×2.8\times1.4×1.4\times的加速。

关键词

引用

@article{arxiv.2012.00912,
  title  = {DYNAMAP: Dynamic Algorithm Mapping Framework for Low Latency CNN Inference},
  author = {Yuan Meng and Sanmukh Kuppannagari and Rajgopal Kannan and Viktor Prasanna},
  journal= {arXiv preprint arXiv:2012.00912},
  year   = {2021}
}

备注

Published in ACM/SIGDA FPGA '21