Origami:一个 803 GOp/s/W 的卷积网络加速器
计算机视觉与模式识别
2016-11-11 v2 人工智能
机器学习
神经与进化计算
摘要
越来越多的计算机视觉与图像/视频处理挑战正通过深度卷积神经网络来解决,并在目标识别与检测、语义分割、动作识别、光流和超分辨率方面取得了 SOTA 结果。这些算法的硬件加速对于在嵌入式和移动计算机视觉系统中采用这些改进至关重要。我们提出了一种新架构、设计与实现,以及此类加速器的首次硅片测量结果,在功耗、面积和 I/O 效率方面均优于以往工作。所制造的器件在 UMC 65nm 工艺下于 3.09 mm^2 的硅片上提供高达 196 GOp/s 的算力,并可实现 803 GOp/s/W 的能效。其大幅降低的带宽需求使其成为首个可扩展至 TOp/s 性能的架构。
引用
@article{arxiv.1512.04295,
title = {Origami: A 803 GOp/s/W Convolutional Network Accelerator},
author = {Lukas Cavigelli and Luca Benini},
journal= {arXiv preprint arXiv:1512.04295},
year = {2016}
}
备注
14 pages