TIMELY:将PIM加速器中的数据移动与接口推向局部化与时域化
机器学习
2020-05-05 v1 硬件体系结构
新兴技术
信号处理
摘要
基于阻变随机存取存储器(ReRAM)的内存处理(RPIM)加速器在弥合物联网设备受限资源与卷积/深度神经网络(CNNs/DNNs)过高能量代价之间的差距方面展现出前景。具体而言,RPIM加速器通过消除权重移动代价并利用ReRAM的高密度提升计算密度来增强能效。然而,能效仍受输入与部分和(Psum)移动的主导性能量代价以及数模(D/A)和模数(A/D)接口代价的限制。本工作中,我们识别了RPIM加速器中的三个节能机会:模拟数据局部性、时域接口和输入访问削减,并提出了一种名为TIMELY的创新RPIM加速器,具有三项关键贡献:(1) TIMELY在ReRAM交叉阵列内采用模拟局部缓冲器(ALBs)以极大增强数据局部性,最小化输入与Psum移动的能量开销;(2) TIMELY通过使用时域接口(TDIs)和所采用的ALBs,分别大幅降低每次单一D/A(及A/D)转换的能量与转换总数;(3) 我们开发了仅一次输入读取(OIR)映射方法,以进一步降低输入访问能量与D/A转换次数。对超过10个CNN/DNN模型及各种芯片配置的评估表明,TIMELY在能效上比基线RPIM加速器PRIME优出一个数量级,同时保持更好的计算密度(高达31.2)与吞吐量(高达736.6)。此外,我们开展了综合研究以评估所提出的ALB、TDI和OIR创新在节能与面积缩减方面的有效性。
引用
@article{arxiv.2005.01206,
title = {TIMELY: Pushing Data Movements and Interfaces in PIM Accelerators Towards Local and in Time Domain},
author = {Weitao Li and Pengfei Xu and Yang Zhao and Haitong Li and Yuan Xie and Yingyan Lin},
journal= {arXiv preprint arXiv:2005.01206},
year = {2020}
}
备注
Accepted by 47th International Symposium on Computer Architecture (ISCA'2020)