MiMo:从预训练到后训练解锁语言模型的推理潜力
计算与语言
2025-06-06 v2 人工智能
机器学习
摘要
我们提出MiMo-7B,这是一个专为推理任务生长的大语言模型,在预训练和后训练阶段均进行优化。预训练阶段,我们增强了数据预处理流程,采用三阶段数据混合策略以强化基础模型的推理潜力。MiMo-7B-Base在25万亿token上进行预训练,并引入额外的多标记预测目标以提升性能并加速推理速度。在后训练阶段,我们构建了13万个可验证的数学和编程问题数据集用于强化学习,集成测试难度驱动的代码奖励方案以缓解稀疏奖励问题,并采用战略数据重抽样以稳定训练。广泛的评估显示,MiMo-7B-Base拥有卓越的推理潜力,甚至优于更大的32B模型。最终的RL调优模型MiMo-7B-RL在数学、代码和通用推理任务上实现卓越性能,超越OpenAI o1-mini。模型checkpoint可在https://github.com/xiaomimimo/MiMo 获取。
引用
@article{arxiv.2505.07608,
title = {MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining},
author = {LLM-Core Xiaomi and : and Bingquan Xia and Bowen Shen and Cici and Dawei Zhu and Di Zhang and Gang Wang and Hailin Zhang and Huaqiu Liu and Jiebao Xiao and Jinhao Dong and Liang Zhao and Peidian Li and Peng Wang and Shihua Yu and Shimao Chen and Weikun Wang and Wenhan Ma and Xiangwei Deng and Yi Huang and Yifan Song and Zihan Jiang and Bowen Ye and Can Cai and Chenhong He and Dong Zhang and Duo Zhang and Guoan Wang and Hao Tian and Haochen Zhao and Heng Qu and Hongshen Xu and Jun Shi and Kainan Bao and Kai Fang and Kang Zhou and Kangyang Zhou and Lei Li and Menghang Zhu and Nuo Chen and Qiantong Wang and Shaohui Liu and Shicheng Li and Shuhao Gu and Shuhuai Ren and Shuo Liu and Sirui Deng and Weiji Zhuang and Weiwei Lv and Wenyu Yang and Xin Zhang and Xing Yong and Xing Zhang and Xingchen Song and Xinzhe Xu and Xu Wang and Yihan Yan and Yu Tu and Yuanyuan Tian and Yudong Wang and Yue Yu and Zhenru Lin and Zhichao Song and Zihao Yue},
journal= {arXiv preprint arXiv:2505.07608},
year = {2025}
}