你的NPU准备好迎接LLM了吗?剖析移动端LLM推理中的隐藏效率瓶颈
硬件体系结构
2026-07-06 v1 人工智能
摘要
在移动设备上部署大语言模型(LLM)增强了隐私性并降低了延迟,但受到硬件效率低下的严重制约。我们首次对移动端LLM推理进行了全面的跨层测量研究,独特地涵盖了五个主流框架(例如,llama.cpp、GENIE)和三个硬件后端(CPU、GPU、NPU)。为了实现这一分析,我们开发了PowerBench,一个细粒度的性能分析工具,它提供了首个后端特定的能耗归因,超越了传统的设备级测量。我们的研究得出了三个关键见解:(1)框架引起的性能差距在NPU上被显著放大,由于不同的卸载和量化策略,使用自定义算子时差距可达10倍。(2)我们识别出一个明显的阶段划分,其中NPU擅长计算受限的预填充,而CPU在内存受限的解码方面优于所有其他后端。这是由NPU偏爱大型、固定形状的工作负载所驱动的,这与解码的小内核、动态特性相冲突。(3)后端特定的性能分析揭示了先前工作遗漏的大量调度空间。次优的线程配置、不协调的NPU休眠延迟和CPU轮询间隔导致高达40%的能耗浪费。利用这些发现,我们提出了一种面向能耗的移动端LLM推理最佳实践配置。我们估计,在三个数据集上,此配置在NPU后端可将能耗降低高达54.8%。
引用
@article{arxiv.2607.05475,
title = {Is Your NPU Ready for LLMs? Dissecting the Hidden Efficiency Bottlenecks in Mobile LLM Inference},
author = {Guanyu Cai and Ruiming Tian and Lang Yang and Zhouhong Ren and Jinliang Yuan and Lingkun Li and Jiliang Wang},
journal= {arXiv preprint arXiv:2607.05475},
year = {2026}
}