中文

边缘部署小型语言模型:CPU、GPU 与 NPU 后端的全面对比

性能 2025-12-10 v2 人工智能

摘要

边缘计算在数据生成位置进行处理,实现更快的决策、降低带宽使用并提升隐私保护。然而,边缘设备通常受限于计算功率、内存和能源消耗,难以承载大型语言模型(LLM)。幸运的是,小型语言模型(SLM)通过显著降低计算成本,为资源受限环境提供了轻量级替代方案,同时适合针对特定领域进行专业化和定制化。在此场景下,选择能够在性能和效率之间取得最佳平衡的硬件平台具有挑战性,因为资源限制极为严苛。为此本研究评估了商业 CPU(Intel 和 ARM)、GPU(NVIDIA)和 NPU(RaiderChip)在运行 SLM 推理时的推理性能和能源效率。虽然 GPU 常作为首选平台与商业 NPU及最新多核 CPU 进行比较。虽然 NPU 利用针对计算优化的定制硬件设计实现高性能,但现代 CPU 正逐步集成针对语言模型工作负载的专用功能。我们采用统一的执行框架和最先进的 SLM 套件,对每种平台的可达到最高性能、处理效率和能源效率进行分析。结果表明,专用后端显著优于通用 CPU,其中 NPU 以显著优势领先。带宽归一化对于跨架构的公平比较至关重要。尽管低功耗 ARM 处理器在能源使用时表现具竞争力,但综合性能与功耗(如 EDP)的指标再次凸显 NPU 作为主导架构。这些发现表明,针对效率与性能均进行优化的设计在边缘工作负载中具有明显优势。

关键词

引用

@article{arxiv.2511.22334,
  title  = {Edge Deployment of Small Language Models, a comprehensive comparison of CPU, GPU and NPU backends},
  author = {Pablo Prieto and Pablo Abad},
  journal= {arXiv preprint arXiv:2511.22334},
  year   = {2025}
}

备注

8 pages, 9 figures