中文

MobileLLM-Pro 技术报告

机器学习 2025-11-11 v1

摘要

面向移动和可穿戴设备的低延迟AI应用,约10亿参数的高效本地语言模型至关重要。然而,在该模型规模下实现卓越性能,同时支持长上下文窗口和实际部署,仍是一大挑战。我们引入MobileLLM-Pro,一个为本地部署优化的10亿参数语言模型。MobileLLM-Pro在11个标准基准测试中实现了最先进成绩,显著超越了Gemma 3-1B和Llama 3.2-1B,同时支持最高128,000个token的上下文窗口,在4位量化情境下表现几乎无明显退化。这些改进得益于四项核心创新:(1)隐式位置蒸馏(implicit positional distillation),一种通过知识蒸馏有效灌输长上下文能力的新技术;(2)专家模型合并框架,将多个领域专家融合至紧凑模型而不增加参数规模;(3)基于效用估计的仿真驱动数据混合;(4)具自我蒸馏的4位量化感知训练。我们将发布模型权重和代码,以支持面向高效本地语言模型的后续研究。

关键词

引用

@article{arxiv.2511.06719,
  title  = {MobileLLM-Pro Technical Report},
  author = {Patrick Huber and Ernie Chang and Wei Wen and Igor Fedorov and Tarek Elgamal and Hanxian Huang and Naveen Suda and Chinnadhurai Sankar and Vish Vogeti and Yanghan Wang and Alex Gladkov and Kai Sheng Tai and Abdelrahman Elogeel and Tarek Hefny and Vikas Chandra and Ahmed Aly and Anuj Kumar and Raghuraman Krishnamoorthi and Adithya Sagar},
  journal= {arXiv preprint arXiv:2511.06719},
  year   = {2025}
}

备注

17 pages