LEAP:基于平衡数据流与细粒度并行的可扩展PIM-NoC架构上LLM推理
硬件体系结构
2025-09-19 v1
摘要
大语言模型(LLM)推理已成为日常生活和行业中的普遍需求。LLM中的大型张量尺寸和计算复杂度给内存、计算和数据总线带来了挑战。本文提出了一种通过聚合内存内计算(PIM)和计算片上网络(NoC)而设计的计算/内存/通信协同设计的非冯·诺依曼加速器,称为LEAP。LLM中的矩阵乘法根据数据动态性被分配到PIM或NoC,以最大化数据局部性。模型划分和映射通过启发式设计空间探索进行优化。专用的细粒度并行性和分块技术实现了PIM和NoC中分布式资源上的高吞吐量数据流。该架构在Llama 1B/8B/13B模型上进行了评估,与A100 GPU相比实现了约2.55倍的吞吐量(tokens/sec)提升和约71.94倍的能量效率(tokens/Joule)提升。
引用
@article{arxiv.2509.14781,
title = {LEAP: LLM Inference on Scalable PIM-NoC Architecture with Balanced Dataflow and Fine-Grained Parallelism},
author = {Yimin Wang and Yue Jiet Chong and Xuanyao Fong},
journal= {arXiv preprint arXiv:2509.14781},
year = {2025}
}
备注
Accepted to the 2025 International Conference on Computer-Aided Design (ICCAD'25)