中文

当NPU并非总是更快:移动端LLM推理的阶段级分析

硬件体系结构 2026-05-28 v1 人工智能

摘要

在移动设备上部署大型语言模型(LLM)越来越依赖于异构执行,然而此前尚无研究在算子和流水线层面系统地表征NPU的有效性。我们提出了首个面向CPU-NPU异构SoC上移动端LLM推理的阶段感知、多级基准测试研究。我们引入了一种基于OPMASK的受控流水线分解方法,该方法能够隔离NPU执行路径中的通信、量化和计算开销。我们的结果揭示了一种反直觉的阶段级性能反转:在计算密集型的预填充(Prefill)阶段,CPU的性能优于NPU(高达1.6倍),而在内存受限的解码(Decode)阶段,NPU仅提供有限的加速(1.05-1.2倍)。我们进一步表明,调度开销和跨后端回退降低了NPU卸载的实际收益。在能耗趋势方面,增加NPU卸载会导致更高的能耗(高达51%)。基于这些发现,我们为面向设备端LLM推理的NPU架构师推导出了设计指南。

关键词

引用

@article{arxiv.2605.27435,
  title  = {When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference},
  author = {Pu Li and Jiawen Qi and Qinyu Chen},
  journal= {arXiv preprint arXiv:2605.27435},
  year   = {2026}
}