中文

ORIGAMI:一种用于学习内存计算的异构拆分架构

机器学习 2019-01-10 v2 机器学习

摘要

内存带宽瓶颈是处理机器学习(ML)算法时的主要挑战之一。内存内加速有潜力解决该问题;然而需应对两个挑战。首先,内存内加速器应足够通用以支持大量不同 ML 算法。其次,它应足够高效以利用带宽,同时不超出 3D 堆叠存储器逻辑层的有限功耗与面积预算。我们注意到以往工作未能同时应对这两挑战。我们提出 ORIGAMI,一组异构内存内加速器,以支持不同 ML 算法的计算需求,并利用现成计算平台(如 FPGA、GPU、TPU 等)在不违反严格面积与功耗预算下利用带宽。ORIGAMI 提供模式匹配技术以识别 ML 算法的相似计算模式,并为每种模式提取计算引擎。这些计算引擎构成集成于 3D 堆叠存储器逻辑层的异构加速器。这些计算引擎的组合可执行任意类型 ML 算法。为在不违反逻辑层面积与功耗预算下利用可用带宽,ORIGAMI 配备计算拆分编译器,以均衡且最小互通信的方式将 ML 算法划分于内存内加速器与片外平台之间。模式匹配与拆分执行的结合为 ML 算法加速提供了新设计点。对 12 种流行 ML 算法的评估显示,ORIGAMI 在性能与能量延迟积(EDP)上分别优于具备 3D 堆叠存储器的最先进加速器 1.5 倍和 29 倍(最高 1.6 倍和 31 倍)。此外,结果处于逻辑层具有无限计算资源的理想系统 1% 误差范围内。

关键词

引用

@article{arxiv.1812.11473,
  title  = {ORIGAMI: A Heterogeneous Split Architecture for In-Memory Acceleration of Learning},
  author = {Hajar Falahati and Pejman Lotfi-Kamran and Mohammad Sadrosadati and Hamid Sarbazi-Azad},
  journal= {arXiv preprint arXiv:1812.11473},
  year   = {2019}
}

备注

11 pages, 9 figures