中文

P3-LLM:面向边缘LLM推理的集成NPU-PIM加速器及混合数值格式

硬件体系结构 2026-05-05 v4 机器学习

摘要

大型语言模型(LLM)的巨大内存带宽和计算需求是高效推理的关键挑战。为此,文献中探索了将神经处理单元(NPU)与基于DRAM的处理器内存储(PIM)组合的异构系统以实现LLM加速。然而,高精度PIM计算单元在DRAM技术中造成显著的面积和功耗开销,限制了有效计算吞吐量。本文引入P3-LLM,一种 novel NPU-PIM集成加速器,用于边缘LLM推理。我们的方案有三个方面:首先,我们提出了灵活的混合精度量化方案,利用混合数值格式对不同LLM操作数进行高压缩率和最小精度损失的量化。其次,我们构建高效的PIM加速器支持混合数值格式。我们仔细选择的数值格式允许在异构系统中设计低精度PIM计算单元,以在相同面积约束下显著提升计算吞吐量。最后,通过对不同LLM模块应用算子融合,优化其低精度数据流以最小化运行时去量化开销。在多样化的LLM和任务上进行评估表明,P3-LLM在准确率上优于最先进的KV缓存量化和权重-激活量化算法。结合所提出的量化方案与低精度PIM架构共设计,P3-LLM相对于最先进的LLM加速器HBM-PIM、Ecco和Pimba平均实现4.9×4.9\times, 2.0×2.0\times, 和3.4×3.4\times的加速。代码已公开。

关键词

引用

@article{arxiv.2511.06838,
  title  = {P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats},
  author = {Yuzong Chen and Chao Fang and Xilai Dai and Yuheng Wu and Thierry Tambe and Marian Verhelst and Mohamed S. Abdelfattah},
  journal= {arXiv preprint arXiv:2511.06838},
  year   = {2026}
}

备注

Accepted to the 53rd IEEE/ACM International Symposium on Computer Architecture (ISCA), 2026