从同伴学习推理模型
计算与语言
2025-05-13 v1
摘要
大型推理模型(LRM)具备即使在推理路径出错时也能自我纠正的能力。然而,我们的研究发现,当推理过程以短暂且较差的开头启动时,模型难以恢复。我们将这一现象称为“前缀主导陷阱”。灵感来自心理学发现,同伴互动可促进自我纠正且不损害已准确者。我们提出**从同伴学习**(LeaP)以解决这一现象。具体而言,每个令牌,每个推理路径都总结其中间推理并通过路由机制与他人共享,从而在推理期间整合同伴见解。然而,我们观察到较小的模型有时未能有效遵循总结和反思指令。为此,我们将其微调为我们的**LeaP-T**模型系列。在AIME 2024、AIME 2025、AIMO 2025和GPQA Diamond上的实验表明,LeaP提供了显著的改进。例如,带LeaP的QwQ-32B在基准测试中平均提升约5分,且在三个数学基准中超越DeepSeek-R1-671B,平均提升3.3分。值得注意的是,我们的微调LeaP-T-7B在AIME 2024上表现与DeepSeek-R1-Distill-Qwen-14B相当。在深入分析中,我们发现LeaP通过及时整合同伴见解实现了强大的错误纠正,展现出强大的容错能力和处理不同难度任务的能力。LeaP为LRM实现了推理期间的协作,标志性里程碑。我们的代码、数据集和模型均可在 https://learning-from-peers.github.io/ 获取。
引用
@article{arxiv.2505.07787,
title = {Learning from Peers in Reasoning Models},
author = {Tongxu Luo and Wenyu Du and Jiaxi Bi and Stephen Chung and Zhengyang Tang and Hao Yang and Min Zhang and Benyou Wang},
journal= {arXiv preprint arXiv:2505.07787},
year = {2025}
}
备注
29 pages, 32 figures