面向移动与嵌入式应用、能效达9.3TOPS/W的CNN专用域加速器
计算机视觉与模式识别
2018-05-04 v1 机器学习
机器学习
摘要
近年来,卷积神经网络(CNN)显著提升了计算机视觉性能。当前,使用CNN算法的应用主要部署在通用硬件(如CPU、GPU或FPGA)上。然而,对于移动和嵌入式应用,需综合考虑功耗、速度、精度、内存占用和芯片面积。CNN的专用域架构(DSA)是CNN部署与实现的高效实用方案。我们设计并流片了一款28nm二维CNN-DSA加速器,具有9.3TOPS/W的超高能效,且所有处理均在内部存储器而非外部DRAM中完成。它以超过140fps分类224x224 RGB图像输入,峰值功耗低于300mW,精度可与VGG基准媲美。该CNN-DSA加速器可重构以支持不同层大小和层类型的CNN模型系数,包括卷积、深度可分离卷积、捷径连接、最大池化和ReLU。此外,为更好支持各类应用场景(尤其是低端移动与嵌入式平台及MCU(微控制器单元))的实际部署,我们还设计了算法以通过降低对外部加速器计算资源的依赖来高效利用CNN-DSA加速器,包括在加速器内实现全连接(FC)层及对CNN-DSA加速器提取的特征进行压缩。基于移动和嵌入式系统的CNN-DSA加速器实时演示表明其具备广泛实际应用的潜力。
引用
@article{arxiv.1805.00361,
title = {Ultra Power-Efficient CNN Domain Specific Accelerator with 9.3TOPS/Watt for Mobile and Embedded Applications},
author = {Baohua Sun and Lin Yang and Patrick Dong and Wenhan Zhang and Jason Dong and Charles Young},
journal= {arXiv preprint arXiv:1805.00361},
year = {2018}
}
备注
9 pages, 10 Figures. Accepted by CVPR 2018 Efficient Deep Learning for Computer Vision workshop