中文

MobileLLM-Flash:面向行业规模部署的低延迟嵌入式 LLM 设计

机器学习 2026-04-29 v2 人工智能

摘要

实时 AI 体验需要针对资源受限硬件优化的嵌入式大型语言模型(OD-LLM)。最有用的 OD-LLM 应产生接近实时的响应,并具备广泛的硬件兼容性,以最大化用户覆盖范围。我们提出一种方法,用于通过硬件-in-the-loop 架构搜索来设计此类模型,在移动端延迟约束下运行。该系统适合行业规模部署:它生成可无需自定义 kernel 即可部署、兼容标准移动运行时(如 Executorch)的模型。我们的方法避免使用专用注意力机制,改用注意力跳过以实现长上下文加速。我们的做法联合优化模型架构(层数、维度)和注意力模式。为高效评估候选方案,我们将每个方案视为预训练背部的修剪版本,继承权重,从而以最小的继续预训练实现高准确率。我们利用延迟评估成本低的分阶段过程:首先学习准确的延迟模型,然后搜索延迟与质量之间的 Pareto 前沿。这产生了 MobileLLM-Flash,即一系列面向高效嵌入式使用的基础模型(3.5 亿、6.5 亿、14 亿参数),支持最高 8k 上下文长度。MobileLLM-Flash 在移动 CPU 上实现了最高 1.8 倍和 1.6 倍的解码速度,质量相当或更优。我们对 Pareto 前沿设计选择的分析提供了可操作的 OD-LLM 设计原则。

关键词

引用

@article{arxiv.2603.15954,
  title  = {MobileLLM-Flash: Latency-Guided On-Device LLM Design for Industry Scale Deployment},
  author = {Hanxian Huang and Igor Fedorov and Andrey Gromov and Bernard Beckerman and Naveen Suda and David Eriksson and Maximilian Balandat and Rylan Conway and Patrick Huber and Chinnadhurai Sankar and Ayushi Dalmia and Zechun Liu and Lemeng Wu and Tarek Elgamal and Adithya Sagar and Vikas Chandra and Raghuraman Krishnamoorthi},
  journal= {arXiv preprint arXiv:2603.15954},
  year   = {2026}
}

备注

Accepted to ACL Industry Track 2026