PIM-LLM:面向1比特大语言模型的高吞吐量混合PIM架构
硬件体系结构
2025-04-04 v1 人工智能
摘要
在本文中,我们提出PIM-LLM,一种用于加速1比特大语言模型(LLM)的混合架构。PIM-LLM利用模拟处理-存储(PIM)架构和数字脉动阵列,分别加速1比特LLM中投影层的低精度矩阵乘法(MatMul)操作和注意力头中的高精度MatMul操作。与传统的硬件加速器相比,我们的设计在每秒处理的令牌数上实现了高达约80倍的提升,每焦耳处理的令牌数增加了70%。此外,PIM-LLM优于先前基于PIM的LLM加速器,在GOPS和GOPS/W上分别至少提升了2倍和5倍,树立了新的基准。
引用
@article{arxiv.2504.01994,
title = {PIM-LLM: A High-Throughput Hybrid PIM Architecture for 1-bit LLMs},
author = {Jinendra Malekar and Peyton Chandarana and Md Hasibul Amin and Mohammed E. Elbtity and Ramtin Zand},
journal= {arXiv preprint arXiv:2504.01994},
year = {2025}
}