SPRING:一种用于训练与推理的稀疏感知精简精度单片三维 CNN 加速器架构
硬件体系结构
2020-06-25 v2
摘要
CNN 在广泛应用上优于传统机器学习算法。然而,其计算复杂性使得设计高效硬件加速器成为必要。大多数 CNN 加速器侧重于探索利用计算并行性的数据流风格。然而,稀疏性带来的潜在性能加速未得到充分解决。若在网络评估中利用稀疏性,CNN 的计算与内存占用可显著减少。为利用稀疏性,一些加速器设计在 CNN 加速器上探索了稀疏编码与评估。但稀疏编码仅针对激活或权重执行,且仅限于推理。已有研究表明,激活与权重在训练期间同样具有高度稀疏性。因此,训练中也应考虑稀疏感知计算。为进一步提升性能与能效,一些加速器以有限精度评估 CNN,但这仅限于推理,因为精简精度若用于训练会牺牲网络精度。此外,CNN 评估通常内存密集,尤其在训练中。本文中,我们提出 SPRING,一种用于训练与推理的稀疏感知精简精度单片三维 CNN(SParsity-aware Reduced-precision Monolithic 3D CNN)加速器。SPRING 支持 CNN 训练与推理。它使用二进制掩码方案对激活与权重中的稀疏性进行编码,使用随机舍入算法以精简精度训练 CNN 而不损失精度。为缓解 CNN 评估中的内存瓶颈(尤其在训练中),SPRING 使用高效的单片三维 NVM 接口来增加内存带宽。与 GTX 1080 Ti 相比,SPRING 在 CNN 训练上分别实现性能、功耗降低和能效 15.6 倍、4.2 倍和 66.0 倍的提升,在推理上分别实现 15.5 倍、4.5 倍和 69.1 倍的提升。
引用
@article{arxiv.1909.00557,
title = {SPRING: A Sparsity-Aware Reduced-Precision Monolithic 3D CNN Accelerator Architecture for Training and Inference},
author = {Ye Yu and Niraj K. Jha},
journal= {arXiv preprint arXiv:1909.00557},
year = {2020}
}