BRAM 是极限:粉碎偏见,塑造标准,构建可扩展的 PIM 加速器
硬件体系结构
2024-10-11 v1
摘要
近期许多基于 FPGA 的处理器内存储器(PIM)架构都承诺实现惊人的并行度,但实际性能却未达预期,原因在于最大时钟频率被削减,无法将处理单元扩展至最大 BRAM 容量,以及对大规模归约运算缺乏硬件支持。本文首先确立我们认为应作为PIM FPGA 设计“黄金标准”的一组设计目标。这一黄金标准旨在作为比较不同技术节点和供应商族群开发的PIM的绝对指标,同时也是设计者的理想目标。随后,我们以一种用于 GEMV 的内存加速引擎 IMAGine 作为案例研究,表明黄金标准在实践中可被实现。IMAGine 作为一种消除许多关于 FPGA 性能限制时钟和规模化误解的存在论证。具体而言,IMAGine 采用最大频率的 BRAM 时钟,并扩展至 100% 的可用 BRAM。 comparative analyses 显示,其在 FPGA 上的执行速度优于现有的 PIM-based GEMV 引擎,时钟速度提高 2.65 倍至 3.2 倍。 presented an AMD Alveo U55 实现,实现系统时钟速度 737 MHz,提供 64K 位串行乘-累加(MAC)单元用于 GEMV 操作。这一成就将 IMAGine 确立为最快的 PIM-based GEMV 叠加,超越目前报道的任何定制 PIM FPGA 加速器。此外,它在时钟速度上超过了 TPU v1-v2 和阿里云 Hanguang 800,同时提供相同或更大的 MAC 单元数量。
引用
@article{arxiv.2410.07546,
title = {The BRAM is the Limit: Shattering Myths, Shaping Standards, and Building Scalable PIM Accelerators},
author = {MD Arafat Kabir and Tendayi Kamucheka and Nathaniel Fredricks and Joel Mandebi and Jason Bakos and Miaoqing Huang and David Andrews},
journal= {arXiv preprint arXiv:2410.07546},
year = {2024}
}
备注
Accepted for poster presentation in FCCM 2024. arXiv admin note: substantial text overlap with arXiv:2410.04367