中文

MiMo:从预训练到后训练解锁语言模型的推理潜力

系统与控制 2025-05-13 v1 机器学习 系统与控制

摘要

我们提出MiMo-7B,这是一个专为推理任务生长的大语言模型,在预训练和后训练阶段均进行优化。预训练阶段,我们增强了数据预处理流程,采用三阶段数据混合策略以强化基础模型的推理潜力。MiMo-7B-Base在25万亿token上进行预训练,并引入额外的多标记预测目标以提升性能并加速推理速度。在后训练阶段,我们构建了13万个可验证的数学和编程问题数据集用于强化学习,集成测试难度驱动的代码奖励方案以缓解稀疏奖励问题,并采用战略数据重抽样以稳定训练。广泛的评估显示,MiMo-7B-Base拥有卓越的推理潜力,甚至优于更大的32B模型。最终的RL调优模型MiMo-7B-RL在数学、代码和通用推理任务上实现卓越性能,超越OpenAI o1-mini。模型checkpoint可在https://github.com/xiaomimimo/MiMo 获取。

关键词

引用

@article{arxiv.2505.07607,
  title  = {Multi-Objective Reinforcement Learning for Energy-Efficient Industrial Control},
  author = {Georg Schäfer and Raphael Seliger and Jakob Rehrl and Stefan Huber and Simon Hirlaender},
  journal= {arXiv preprint arXiv:2505.07607},
  year   = {2025}
}

备注

Accepted at DEXA 2025 (AI4IP)