Synergy:一种面向嵌入式异构SoC上高吞吐CNN的软硬件协同框架
分布式、并行与集群计算
2019-03-07 v1 硬件体系结构
机器学习
摘要
卷积神经网络(CNN)已广泛部署于多种应用领域。在利用高性能GPU、FPGA和定制ASIC加速其训练与推理方面,面向数据中心规模环境已取得显著进展。近年来移动与物联网设备的激增,使得在资源受限的嵌入式平台上实现实时、高能效的深度神经网络推理成为必要。在此背景下,我们提出Synergy,一种面向嵌入式异构系统级芯片(SoC)架构(Xilinx Zynq)的自动化软硬件协同设计、流水线化、高吞吐CNN推理框架。Synergy通过多线程利用所有可用的片上资源,包括双核ARM处理器以及作为加速器的FPGA和NEON SIMD引擎。此外,Synergy提供异构加速器(FPGA与NEON)的统一抽象,并可通过工作窃取在加速器间平衡负载,在运行时适应不同网络配置而无需更改底层硬件加速器架构。相比经过充分优化的纯软件方案,Synergy在七种CNN模型上平均实现7.3倍加速,并展现出优于同架构现有CNN实现的吞吐量与能效。
引用
@article{arxiv.1804.00706,
title = {Synergy: A HW/SW Framework for High Throughput CNNs on Embedded Heterogeneous SoC},
author = {Guanwen Zhong and Akshat Dubey and Tan Cheng and Tulika Mitra},
journal= {arXiv preprint arXiv:1804.00706},
year = {2019}
}
备注
34 pages, submitted to ACM Transactions on Embedded Computing Systems (TECS)