中文

MobileLLM-R1:基于开放训练方案探索亚十亿参数语言模型推理器的极限

计算与语言 2026-03-02 v3 人工智能

摘要

大型语言模型(LLM)从直觉响应到思维链(CoT)推理的范式转变引发了两个普遍假设:(1)推理能力仅在足够大的模型中才会出现;(2)此类能力需要在海量数据集上进行训练。尽管第一个假设已受到近期亚十亿参数推理模型(如 Qwen3-0.6B 和 DeepSeek 蒸馏变体)的挑战,但第二个假设在很大程度上仍未被质疑。在本工作中,我们重新审视了将语料库扩展到极大规模(>10T tokens)以实现推理涌现的必要性。通过精心筛选和重采样我们在所设计指标下认定为有益的开源数据集,我们证明了强大的推理能力可以用少得多的数据涌现出来。具体而言,我们表明仅需约 2T tokens 的高质量数据即可,并且使用从这些约 2T tokens 中重采样的数据集进行 4.2T tokens 的预训练,随后进行既定的后训练流程,即可开发出 MobileLLM-R1——一系列在完全开源数据上训练的、性能大幅超越以往模型的亚十亿参数推理模型。例如,MobileLLM-R1-950M 的 AIME 得分为 15.5,而 OLMo-2-1.48B 仅为 0.6,SmolLM-2-1.7B 仅为 0.3。值得注意的是,尽管预训练所用的 tokens 仅为 Qwen3 专有 36T-token 语料库的 11.7%,MobileLLM-R1-950M 在多个推理基准测试上仍匹配或超越了 Qwen3-0.6B。为了促进该方向的进一步研究,我们已将模型 (https://huggingface.co/collections/facebook/mobilellm-r1) 和代码 (https://github.com/facebookresearch/MobileLLM-R1) 以及完整的训练方案、数据源和数据混合比例公开发布。

关键词

引用

@article{arxiv.2509.24945,
  title  = {MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes},
  author = {Changsheng Zhao and Ernie Chang and Zechun Liu and Chia-Jung Chang and Wei Wen and Chen Lai and Sheng Cao and Yuandong Tian and Raghuraman Krishnamoorthi and Yangyang Shi and Vikas Chandra},
  journal= {arXiv preprint arXiv:2509.24945},
  year   = {2026}
}

备注

ICLR 2026