中文

Motif-2-12.7B-Reasoning:RL训练配方实用指南

人工智能 2025-12-15 v1

摘要

我们介绍Motif-2-12.7B-Reasoning,这是一个12.7B参数语言模型,旨在弥合开源系统与专有前沿模型在复杂推理和长上下文理解能力之间的差距。针对推理适应中常见的模型崩溃和训练不稳定问题,我们提出了一套全面且可复现的训练配方,涵盖系统、数据和算法优化。我们的ethods结合了用于64K token上下文的内存高效基础设施,采用混合并行和内核级优化,同时采用两阶段监督微调(SFT)课程,通过验证的、对齐的合成数据来缓解分布不匹配。此外,我们详细描述了一套稳健的强化学习微调(RLFT)管道,通过难度感知数据过滤和混合策略轨迹重用来稳定训练。实证结果表明,Motif-2-12.7B-Reasoning在数学、编码和智能体基准测试中达到了与参数规模显著更大模型相当的性能,为社区提供了一个具竞争力的开源模型和在现实计算限制下扩展推理能力的实用蓝图。

关键词

引用

@article{arxiv.2512.11463,
  title  = {Motif-2-12.7B-Reasoning: A Practitioner's Guide to RL Training Recipes},
  author = {Junghwan Lim and Sungmin Lee and Dongseok Kim and Taehyun Kim and Eunhwan Park and Jeesoo Lee and Jeongdoo Lee and Junhyeok Lee and Wai Ting Cheung and Dahye Choi and Minsu Ha and Jaeheui Her and Jaeyeon Huh and Hanbin Jung and Changjin Kang and Beomgyu Kim and Minjae Kim and Taewhan Kim and Youngrok Kim and Hyukjin Kweon and Haesol Lee and Kungyu Lee and Dongpin Oh and Yeongjae Park and Bokki Ryu and Dongjoo Weon},
  journal= {arXiv preprint arXiv:2512.11463},
  year   = {2025}
}