中文

面向FPGA高效边缘计算的卷积神经网络压缩自动化流程

硬件体系结构 2017-12-19 v1 人工智能 神经与进化计算

摘要

基于深度卷积神经网络(CNN)的解决方案是当前计算机视觉任务的最先进水平。由于这些模型规模庞大,通常在CPU或GPU集群上运行。然而,功耗需求和成本预算可能成为在物联网应用中采用CNN的主要障碍。近期研究指出,CNN结构中存在显著冗余,可量化至较低位宽参数与激活值,同时保持可接受精度。低位宽尤其是单比特位宽(二值)CNN因二值化CNN中涉及的位级逻辑操作,特别适合基于FPGA实现的移动应用。此外,向低位宽的转变开启了性能优化与模型改进的新途径。本文提出从训练好的TensorFlow模型到二值化CNN的FPGA片上系统实现的自动流程。该流程包括模型参数与激活值的量化、嵌入式C中网络与模型的生成,以及二值卷积FPGA加速器的自动生成。该自动化流程通过在低成本、低功耗Cyclone-V FPGA器件上实现二值化“YOLOV2”得以演示。使用二值化YOLOV2进行目标检测的实验表明,与CPU和移动CPU平台相比,FPGA在模型大小和推理速度方面具有显著性能优势。此外,从训练模型到FPGA综合的整个自动化流程可在一小时内完成。

关键词

引用

@article{arxiv.1712.06272,
  title  = {Automated flow for compressing convolution neural networks for efficient edge-computation with FPGA},
  author = {Farhan Shafiq and Takato Yamada and Antonio T. Vilchez and Sakyasingha Dasgupta},
  journal= {arXiv preprint arXiv:1712.06272},
  year   = {2017}
}

备注

7 pages, 9 figures. Accepted and presented at MLPCD workshop, NIPS 2017 (LongBeach, California)