Marco-o1: 面向开放式解答的开放推理模型
计算与语言
2024-11-26 v2
摘要
目前,OpenAI o1 引发了对大规模推理模型(LRM)研究的浓厚兴趣。建设在这一动力基础上,Marco-o1不仅聚焦于标准答案领域,如数学、物理和编程——这些领域适合强化学习(RL),而且更强调开放式解决方案。我们旨在回答以下问题:“o1模型能否有效地泛化到那些缺乏明确标准且奖励难以量化的更广泛领域?”Marco-o1由链式思维(Chain-of-Thought, CoT)微调、蒙特卡洛树搜索(MCTS)、反思机制以及创新推理策略驱动,旨在优化复杂现实问题的解决任务。
引用
@article{arxiv.2411.14405,
title = {Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions},
author = {Yu Zhao and Huifeng Yin and Bo Zeng and Hao Wang and Tianqi Shi and Chenyang Lyu and Longyue Wang and Weihua Luo and Kaifu Zhang},
journal= {arXiv preprint arXiv:2411.14405},
year = {2024}
}