基于 SOT-MRAM 的存内处理引擎用于高度压缩 DNN 实现
信号处理
2019-12-12 v1 计算机视觉与模式识别
分布式、并行与集群计算
新兴技术
机器学习
神经与进化计算
摘要
深度神经网络(DNNs)的计算墙与数据搬移挑战已暴露出传统基于 CMOS 的 DNN 加速器的局限。此外,深层结构与大模型尺寸将使 DNNs 难以用于需要低功耗的嵌入式系统与 IoT 设备。为应对这些挑战,自旋轨道转矩磁随机存取存储器(SOT-MRAM)及基于 SOT-MRAM 的存内处理(PIM)引擎因其近零待机功耗、高密度、非易失等特性而被用于降低 DNNs 功耗。然而,基于 SOT-MRAM 的 PIM 引擎存在写入延迟高、需低比特宽度数据等缺点,削弱了其作为节能 DNN 加速器的受欢迎程度。为缓解这些缺点,我们提出一种超高能效框架,从软件层面利用权重剪枝与量化等模型压缩技术,并考虑 SOT-MRAM PIM 的架构。我们将交替方向乘子法(ADMM)引入训练阶段,以进一步保证解的可行性并满足 SOT-MRAM 硬件约束。由此,SOT-MRAM PIM 的占用面积与功耗得以降低,同时整体系统吞吐量增加,使我们提出的基于 ADMM 的 SOT-MRAM PIM 更具能效,适用于嵌入式系统或 IoT 设备。实验结果表明,我们所提框架的精度与压缩率持续优于对比工作,且 SOT-MRAM PIM 引擎的效率(面积与功耗)与吞吐量显著提升。
引用
@article{arxiv.1912.05416,
title = {A SOT-MRAM-based Processing-In-Memory Engine for Highly Compressed DNN Implementation},
author = {Geng Yuan and Xiaolong Ma and Sheng Lin and Zhengang Li and Caiwen Ding},
journal= {arXiv preprint arXiv:1912.05416},
year = {2019}
}