中文

实现自我提升推理能力的认知行为,或四种高效STaRs的习惯

计算与语言 2025-08-18 v2 机器学习

摘要

测试时推理已成为一种强大的范式,使语言模型能够像专业人类专家一样更仔细地思考复杂挑战。尽管强化学习(RL)可推动语言模型在可验证任务上的自我提升,但一些模型表现出显著的提升,而另一些模型则很快出现平台期。例如,我们发现Qwen-2.5-3B在相同的RL训练下远超Llama-3.2-3B,用于 Countdown游戏。这一差异引发了一个关键问题:哪些内在属性使模型能够有效实现自我提升?我们引入一种框架,通过分析四种关键认知行为——验证、回溯、子目标设定和逆向链式推理——来 investigation此问题,这些行为 both expert human problem solvers and successful language models都会采用。我们的研究发现,Qwen天然具备这些推理行为,而Llama初始则不具备。在受控行为数据集上进行系统实验中,我们发现,用包含这些推理行为的示例来预热Llama,可在RL期间实现显著提升,甚至超过Qwen的性能。重要的是,推理行为的存在而非答案的正确性,是决定模型性能的关键因素——预热于错误解决方案但包含恰当推理模式的模型, achieved comparable performance to those trained on correct solutions。最终,通过利用以OpenWebMath数据为基础的持续预训练并优化以放大推理行为,Llama模型能够匹配Qwen的自我提升轨迹。我们的发现建立了初始推理行为与提升能力之间的根本关系,解释了为何一些语言模型有效地利用额外计算资源,而另一些则出现平台期。

关键词

引用

@article{arxiv.2503.01307,
  title  = {Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs},
  author = {Kanishk Gandhi and Ayush Chakravarthy and Anikait Singh and Nathan Lile and Noah D. Goodman},
  journal= {arXiv preprint arXiv:2503.01307},
  year   = {2025}
}