从弱监督激励强推理
计算与语言
2026-03-17 v3 人工智能
摘要
大型语言模型(LLM)在推理密集型任务上展现出了令人印象深刻的性能,但提升其推理能力通常依赖于使用可验证信号进行强化学习(RL),或使用高质量的长思维链(CoT)演示进行监督微调(SFT),这两者成本都很高昂。在本文中,我们研究了一个新问题:在没有昂贵的高质量演示和强化学习的情况下,激励 LLM 的推理能力。我们探讨了 LLM 的推理能力是否可以通过显著更弱的模型的监督来有效激励。我们进一步分析了这种弱监督何时以及为何能够成功激发更强模型的推理能力。我们的研究结果表明,来自显著更弱推理器的监督可以大幅提高学生模型的推理性能,以极低成本恢复了昂贵 RL 近 94% 的增益。在多种基准测试和模型架构上的实验表明,弱推理器能够有效激励更强学生模型的推理,在广泛的推理任务上持续提升性能。我们的结果表明,这种简单的弱到强范式是一种极具前景且可推广的替代方案,用于在 LLM 推理时激励强推理能力而无需高昂成本。代码已公开发布于 https://github.com/yuanyige/w2sr。
引用
@article{arxiv.2505.20072,
title = {Incentivizing Strong Reasoning from Weak Supervision},
author = {Yige Yuan and Teng Xiao and Shuchang Tao and Xue Wang and Jinyang Gao and Bolin Ding and Bingbing Xu},
journal= {arXiv preprint arXiv:2505.20072},
year = {2026}
}
备注
Accepted at EACL 2026