XNORBIN:一种用于二值卷积神经网络的 95 TOp/s/W 硬件加速器
计算机视觉与模式识别
2018-09-12 v1 人工智能
硬件体系结构
神经与进化计算
图像与视频处理
摘要
部署 state-of-the-art 的 CNN 需要高功耗的处理器和片外存储器。这阻碍了在低功耗嵌入式系统中实现 CNN。最近的研究表明,CNN 能够承受极端量化,将其权重和中间特征图二值化,从而节省 8-32 倍的内存,并将耗能的乘加运算缩减为 XNOR-and-popcount 操作。我们提出了 XNORBIN,一种用于二值 CNN 的加速器,其计算与存储器紧密耦合以实现激进的数据重用。XNORBIN 采用 UMC 65nm 工艺实现,在 0.8 V 电压下实现了 95 TOp/s/W 的能效和 2.0 TOp/s/MGE 的面积效率。
引用
@article{arxiv.1803.05849,
title = {XNORBIN: A 95 TOp/s/W Hardware Accelerator for Binary Convolutional Neural Networks},
author = {Andrawes Al Bahou and Geethan Karunaratne and Renzo Andri and Lukas Cavigelli and Luca Benini},
journal= {arXiv preprint arXiv:1803.05849},
year = {2018}
}