P3-LLM:面向边缘LLM推理的集成NPU-PIM加速器及混合数值格式
硬件体系结构
2026-05-05 v4 机器学习
摘要
大型语言模型(LLM)的巨大内存带宽和计算需求是高效推理的关键挑战。为此,文献中探索了将神经处理单元(NPU)与基于DRAM的处理器内存储(PIM)组合的异构系统以实现LLM加速。然而,高精度PIM计算单元在DRAM技术中造成显著的面积和功耗开销,限制了有效计算吞吐量。本文引入P3-LLM,一种 novel NPU-PIM集成加速器,用于边缘LLM推理。我们的方案有三个方面:首先,我们提出了灵活的混合精度量化方案,利用混合数值格式对不同LLM操作数进行高压缩率和最小精度损失的量化。其次,我们构建高效的PIM加速器支持混合数值格式。我们仔细选择的数值格式允许在异构系统中设计低精度PIM计算单元,以在相同面积约束下显著提升计算吞吐量。最后,通过对不同LLM模块应用算子融合,优化其低精度数据流以最小化运行时去量化开销。在多样化的LLM和任务上进行评估表明,P3-LLM在准确率上优于最先进的KV缓存量化和权重-激活量化算法。结合所提出的量化方案与低精度PIM架构共设计,P3-LLM相对于最先进的LLM加速器HBM-PIM、Ecco和Pimba平均实现, , 和的加速。代码已公开。
引用
@article{arxiv.2511.06838,
title = {P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats},
author = {Yuzong Chen and Chao Fang and Xilai Dai and Yuheng Wu and Thierry Tambe and Marian Verhelst and Mohamed S. Abdelfattah},
journal= {arXiv preprint arXiv:2511.06838},
year = {2026}
}
备注
Accepted to the 53rd IEEE/ACM International Symposium on Computer Architecture (ISCA), 2026