面向权重共享卷积神经网络的低复杂度乘累加单元
硬件体系结构
2018-05-03 v3
摘要
卷积神经网络(CNNs)是图像、语音和视频处理中最成功的机器学习技术之一。CNNs 需要大量的处理能力和内存带宽。已有针对 CNNs 的硬件加速器被提出,其通常包含大量乘累加(MAC)单元,其中的乘法器在集成电路(IC)门数和功耗方面都很大。已有“权重共享”加速器被提出,其中训练好的 CNN 中权重值的全部范围被压缩并放入分箱(bin),并使用分箱索引来访问权重共享值。我们通过在权重共享 CNN 中实现并行累加共享 MAC(PASM)来降低 CNN 的功耗和面积。PASM 重新架构了 MAC,改为统计每个权重的出现频率并将其放入分箱。累加值在后续的乘法阶段计算,显著降低了 CNN 的门数和功耗。在本文中,我们在权重共享的 CNN 卷积硬件加速器中实现 PASM 并分析其有效性。实验表明,对于在 45nm ASIC 工艺上实现的 1GHz 时钟速度,我们的方法减少了门数、更小的逻辑和更低的功耗,仅带来轻微的延迟增加。我们还表明,相同的带 PASM 的权重共享 CNN 加速器可以在资源受限的 FPGA 中实现,其中 FPGA 具有有限数量的数字信号处理器(DSP)单元来加速 MAC 操作。
引用
@article{arxiv.1801.10219,
title = {Low Complexity Multiply-Accumulate Units for Convolutional Neural Networks with Weight-Sharing},
author = {James Garland and David Gregg},
journal= {arXiv preprint arXiv:1801.10219},
year = {2018}
}