eCNN:一种基于块且高度并行的边缘推理 CNN 加速器
分布式、并行与集群计算
2019-10-15 v1 计算机视觉与模式识别
机器学习
图像与视频处理
摘要
卷积神经网络(CNNs)最近在计算成像应用中展示了卓越的质量。因此,它们具有彻底改变相机和显示器上图像流水线的巨大潜力。然而,由于可观的 DRAM 带宽和功耗,传统 CNN 加速器难以在边缘支持超高分辨率视频。因此,寻找一种进一步节省内存和计算量的微架构对于加速这场即将到来的革命至关重要。在本文中,我们通过联合考虑推理流、网络模型、指令集和处理器设计来优化硬件性能和图像质量来实现这一目标。我们应用基于块的推理流,可消除特征图的所有 DRAM 带宽,并相应提出面向硬件的网络模型 ERNet,以基于硬件约束优化图像质量。然后我们设计了一种粗粒度指令集架构 FBISA,通过大规模并行支持高功耗的卷积。最后,我们实现了一个嵌入式处理器——eCNN——它以灵活的处理架构适配 ERNet 和 FBISA。布局结果表明,它可支持高质量的 ERNet 用于超分辨率和去噪,达到 4K 超高清 30 fps,同时仅使用 DDR-400 且平均功耗 6.94W。相比之下,最先进的 Diffy 使用双通道 DDR3-2133 并消耗 54.3W 以支持较低质量的 VDSR 在全高清 30 fps。最后,我们还将展示高性能风格迁移和物体识别的应用示例,以证明 eCNN 的灵活性。
引用
@article{arxiv.1910.05680,
title = {eCNN: A Block-Based and Highly-Parallel CNN Accelerator for Edge Inference},
author = {Chao-Tsung Huang and Yu-Chun Ding and Huan-Ching Wang and Chi-Wen Weng and Kai-Ping Lin and Li-Wei Wang and Li-De Chen},
journal= {arXiv preprint arXiv:1910.05680},
year = {2019}
}
备注
14 pages; appearing in IEEE/ACM International Symposium on Microarchitecture (MICRO), 2019