基于 Apple Silicon NPU 的高效 Mixture-of-Experts LLM 推理
机器学习
2026-04-22 v1
摘要
Apple Neural Engine (ANE) 是每款 Apple Silicon 芯片中集成的专用神经处理单元 (NPU)。Mixture-of-Experts (MoE) 大语言模型 (LLM) 通过稀疏激活来提高推理效率,但在 NPU 上面临三大挑战:专家路由不可预测,导致动态张量形状与 NPU 的形状特定约束冲突;多个不规则算子(如 top-k、scatter/gather 等)不友好;以及启动大量小型专家内核会造成显著的调度和同步开销。NPU 旨在卸载 AI 计算,使其从 CPU 和 GPU 卸载;我们的目标是在 Apple Silicon 上实现 MoE 推理的 offloading,特别是在 prefill 阶段,后端工作负载消耗了大量系统资源。本文提出了 NPUMoE,一个加速 Apple Silicon 上 MoE 执行的推理引擎,通过将密集、静态计算卸载到 NPU,同时保留 CPU/GPU 的后备路径以处理动态操作。NPUMoE 使用离线校准来估计专家容量和流行度,从而驱动三项关键技术:(1)静态专家容量层级以解决动态专家路由问题;(2)分组专家执行以缓解 NPU 并发限制;(3)负载感知的专家计算图驻留以减少 CPU-NPU 同步开销。在 Apple M 系列设备上使用三个代表性 MoE LLM 和四种长上下文工作负载的实验表明,NPUMoE 始终优于基线方案,通过有效的 NPU offloading 将延迟降低1.32倍至5.55倍,将能源效率提高1.81倍至7.37倍,将 CPU 周期使用降低1.78倍至5.54倍。
引用
@article{arxiv.2604.18788,
title = {Efficient Mixture-of-Experts LLM Inference with Apple Silicon NPUs},
author = {Afsara Benazir and Felix Xiaozhu Lin},
journal= {arXiv preprint arXiv:2604.18788},
year = {2026}
}