中文

RePAST:一种基于 ReRAM 的 PIM 加速器,用于 DNN 的二阶训练

硬件体系结构 2022-10-28 v1

摘要

在 DNN 训练中,二阶训练方法的收敛速度远快于一阶优化器。这是因为二阶训练利用二阶信息(SOI)矩阵的逆来寻找更精确的下降方向和步长。然而,庞大的 SOI 矩阵在 GPU 和 CPU 等传统架构中带来了显著的计算和存储开销。另一方面,基于 ReRAM 的内存内处理(PIM)技术适用于二阶训练,原因有三:第一,PIM 的计算发生在内存中,减少了数据移动开销;第二,ReRAM 交叉开关阵列能在 O(1)O\left(1\right) 时间内计算 SOI 的逆;第三,若架构设计得当,ReRAM 交叉开关阵列可执行对二阶训练算法至关重要的矩阵求逆和向量-矩阵乘法。尽管如此,当前的基于 ReRAM 的 PIM 技术在加速二阶训练方面仍面临一个关键挑战。现有的基于 ReRAM 的矩阵求逆电路仅支持 8 位精度矩阵求逆,而二阶训练需要至少 16 位精度的矩阵求逆,现有计算精度不足。在这项工作中,我们提出了一种基于已验证的 8 位矩阵求逆(INV)电路和向量-矩阵乘法(VMM)电路实现高精度矩阵求逆的方法。我们设计了 \archname{},一种基于 ReRAM 的 PIM 加速器架构,用于二阶训练。此外,我们为 \archname{} 提出了一种软件映射方案,通过融合 VMM 和 INV 交叉开关阵列来进一步优化性能。实验表明,在大规模 DNN 上,与 GPU 同类方案和 PipeLayer 相比,\archname{} 平均可实现 115.8×\times/11.4×\times 的加速比和 41.9×\times/12.8×\times 的能耗节省。

关键词

引用

@article{arxiv.2210.15255,
  title  = {RePAST: A ReRAM-based PIM Accelerator for Second-order Training of DNN},
  author = {Yilong Zhao and Li Jiang and Mingyu Gao and Naifeng Jing and Chengyang Gu and Qidong Tang and Fangxin Liu and Tao Yang and Xiaoyao Liang},
  journal= {arXiv preprint arXiv:2210.15255},
  year   = {2022}
}

备注

13pages, 13 figures