Orion: characterizing and programming Apple 的神经引擎用于 LLM 训练与推理
机器学习
2026-03-10 v1 硬件体系结构
计算与语言
摘要
两倍以上的 Apple 设备配备神经处理单元(NPU)—Apple 神经引擎(ANE)— yet 此加速器在大语言模型工作负载中基本未被利用。CoreML,Apple 的公共 ML 框架,施加了不透明的抽象,阻止直接 ANE 编程且不支持本地训练。我们提出了 Orion,据称首个将直接 ANE 执行、编译器管道和稳定多步骤训练带检查点恢复于单一本地运行时的开放系统,完全绕过 CoreML,通过 Apple 的私有 _ANEClient 和 _ANECompiler API。建立在 maderix 先前表征工作基础上,我们将 ANE 限制扩展到 20 项关于 MIL IR 程序、内存布局、编译限制和数值行为的约束,包括 14 项此前未记录的约束是在 Orion 开发期间发现。Orion 包括一个将图 IR 通过五个优化通过降至 ANE 原生 MIL 的编译器,以及管理 IOSurface 后备零拷贝张量 I/O、程序缓存和增量编译的运行时。由于 ANE 在编译时烤制权重,通常需要每步完整重新编译(~4.2 秒)。我们表明,编译后的程序可通过卸载、修补权重文件并重新加载来更新,绕过 ANECCompile(),将每步重新编译从 4200 毫秒降至 494 毫秒(8.5 倍),实现 3.8 倍训练加速。在 M4 Max 上,Orion 实现 GPT-2 124M 推理 170+ token/s,并在 TinyStories 上对 110M 参数变换器进行稳定训练,1000 步仅需 22 分钟且无 NaN 产生。我们还展示了 LoRA adapter-as-input,通过 IOSurface 输入实现热插拔适配器,无需重新编译。
关键词
引用
@article{arxiv.2603.06728,
title = {Orion: Characterizing and Programming Apple's Neural Engine for LLM Training and Inference},
author = {Ramchand Kumaresan},
journal= {arXiv preprint arXiv:2603.06728},
year = {2026}
}