T-MAN:通过统一表查找实现 NPU 上低位 LLM 端到端推理
硬件体系结构
2025-11-17 v1
摘要
大型语言模型 (LLM) 正在部署到客户设备上。为支持这些模型,当前设备正在采用配备 NPU (神经处理单元) 的 SoC (系统级芯片)。尽管预期性能出色,但在 NPU 上进行 LLM 推理仍比其 CPU 桌面版慢。其原因在于 NPU 在除 GEMM 之外的计算(如去量化)性能较差。现有方法要么将 prefill 在 NPU 上进行而将解码在 CPU 上进行,要么将两者都放在 NPU 上但会导致精度损失。为解决此问题,基于低位即可在可接受大小的表中编码目标计算的洞见,我们提出了表查找来取代其他不受支持的硬件操作。为实现这一点,我们通过 (1) 融合双层表基于去量化和 (2) 基于并发层次感知的分块来克服 prefill 和解码的硬件行为冲突,设计统一的表布局和分块。基于此,我们通过三阶段流水线实现 prefill 阶段,并将基于表查找的解码映射到 NPU 的向量单元。结果显示,prefill 和解码分别实现了 1.4 倍和 3.1 倍的加速,能源消耗较基准 NPU 方法降低了 84%。代码已公开 https://github.com/microsoft/T-MAC/tree/main/t-man。
引用
@article{arxiv.2511.11248,
title = {T-MAN: Enabling End-to-End Low-Bit LLM Inference on NPUs via Unified Table Lookup},
author = {Jianyu Wei and Qingtao Li and Shijie Cao and Lingxiao Ma and Zixu Hao and Yanyong Zhang and Xiaoyan Hu and Ting Cao},
journal= {arXiv preprint arXiv:2511.11248},
year = {2025}
}