中文

Marco-o1 v2: 致力于扩大推理模型蒸馏瓶颈

机器学习 2025-06-03 v2 人工智能 计算与语言

摘要

大型推理模型 (LRMs) 如 OpenAI o1 和 DeepSeek-R1 通过扩大测试时间计算量和生成长链思维 (CoT) 显示出卓越的推理能力。蒸馏——即在 LRMs 生成的数据上进行后训练——是一种直接且有效的方法来增强小型模型的推理能力,但面临一个关键瓶颈:我们发现长 CoT 数据对小型模型具有学习难度,并在使用监督微调 (SFT) 和强化学习 (RL) 方法时导致偏见继承 (即过度思考)。为缓解此瓶颈,我们提出了通过蒙特卡洛树搜索 (MCTS) 从头构建树状 CoT 数据的方法。我们利用一组 CoT aware 方法,包括 Thoughts Length Balance、Fine-grained DPO 和 Joint Post-training Objective,来增强 SFT 和 RL 在构建数据上的表现。我们在各种基准测试中进行了评估,包括数学 (GSM8K、MATH、AIME)、指令遵循 (Multi-IF) 和规划 (Blocksworld),结果表明我们的方法显著优于通过标准蒸馏模型获得的模型,减少了长时间思考中的幻觉。项目主页为 https://github.com/AIDC-AI/Marco-o1。

关键词

引用

@article{arxiv.2503.01461,
  title  = {Marco-o1 v2: Towards Widening The Distillation Bottleneck for Reasoning Models},
  author = {Huifeng Yin and Yu Zhao and Minghao Wu and Xuanfan Ni and Bo Zeng and Hao Wang and Tianqi Shi and Liangying Shao and Chenyang Lyu and Longyue Wang and Weihua Luo and Kaifu Zhang},
  journal= {arXiv preprint arXiv:2503.01461},
  year   = {2025}
}