MiMo:从预训练到后训练解锁语言模型的推理潜力
系统与控制
2025-05-13 v1 机器学习
系统与控制
摘要
我们提出MiMo-7B,这是一个专为推理任务生长的大语言模型,在预训练和后训练阶段均进行优化。预训练阶段,我们增强了数据预处理流程,采用三阶段数据混合策略以强化基础模型的推理潜力。MiMo-7B-Base在25万亿token上进行预训练,并引入额外的多标记预测目标以提升性能并加速推理速度。在后训练阶段,我们构建了13万个可验证的数学和编程问题数据集用于强化学习,集成测试难度驱动的代码奖励方案以缓解稀疏奖励问题,并采用战略数据重抽样以稳定训练。广泛的评估显示,MiMo-7B-Base拥有卓越的推理潜力,甚至优于更大的32B模型。最终的RL调优模型MiMo-7B-RL在数学、代码和通用推理任务上实现卓越性能,超越OpenAI o1-mini。模型checkpoint可在https://github.com/xiaomimimo/MiMo 获取。
引用
@article{arxiv.2505.07607,
title = {Multi-Objective Reinforcement Learning for Energy-Efficient Industrial Control},
author = {Georg Schäfer and Raphael Seliger and Jakob Rehrl and Stefan Huber and Simon Hirlaender},
journal= {arXiv preprint arXiv:2505.07607},
year = {2025}
}
备注
Accepted at DEXA 2025 (AI4IP)