单片 3D ReRAM 交叉阵列中多通道卷积的高效实现
硬件体系结构
2020-04-02 v1
摘要
卷积神经网络(CNNs)在广泛应用中有前景的准确性。在 CNNs 的所有层中,卷积层计算最密集且能耗最高。随着器件与制造技术的成熟,3D 阻变随机存取存储器(ReRAM)因其高并行性与能效优势,在加速大型向量-矩阵乘法与卷积方面受到大量关注。然而,在 3D ReRAM 中朴素地实现多通道卷积要么产生错误结果,要么仅利用了 3D ReRAM 的部分并行性。本文中,我们提出了一种基于 3D ReRAM 的卷积加速器架构,其将多通道卷积高效映射到单片 3D ReRAM。我们的设计有两个关键原则。第一,我们利用 3D ReRAM 的交织结构,通过一种最先进的卷积算法实现多通道卷积。第二,我们提出一种新方法,利用可配置互连将负权重与非负权重分离,以高效实现负权重。我们的评估表明,在 16 层 3D ReRAM 中的映射方案相比定制的 2D ReRAM 基线以及最先进的 CPU 和 GPU,分别实现了 5.79X、927.81X 和 36.8X 的加速。我们的设计相比相同基线也分别降低了 2.12X、1802.64X 和 114.1X 的能耗。
引用
@article{arxiv.2004.00243,
title = {Efficient Implementation of Multi-Channel Convolution in Monolithic 3D ReRAM Crossbar},
author = {Sho Ko and Yun Joon Soh and Jishen Zhao},
journal= {arXiv preprint arXiv:2004.00243},
year = {2020}
}