中文

超越必需品:在结果监督下扩展训练推理长度的隐藏收益

机器学习 2026-02-03 v1

摘要

训练大语言模型进行更长的推理思考已成为构建能够解决复杂问题的前沿模型的关键要素。最近的研究以不同方式 pursuit此目标,例如通过RL微调以激发长链思维(coT),或通过架构递归扩展潜在推理。这种做法将推理长度置于重要的扩展旋钮中。本文中,我们发现了一种新现象(理论上和实验上):在仅有结果监督的情况下,随着训练时推理长度(例如RL中的token预算,或循环式Transformer的循环次数)增加,模型在分布外(OOD)性能可以持续提升,即使在分布内(ID)性能已饱和。这表明鲁棒性可能需要超过ID验证所 indicat的更大预算。我们通过两种机制提供了理论解释:(i)自迭代可在假设类中引发更强的归纳偏置,重新塑造ID最优解,从而改善OOD泛化;(ii)当存在些在ID样本上有效但在OOD样本上无效的捷径解决方案时,随着自迭代次数增加,正则化可减少所学习解对这些捷径的依赖。我们通过两种实现训练时推理长度扩展的实证证据来补充理论:在合成任务上增加循环式Transformer的循环次数,以及在数学推理任务上通过RL微调增加token预算。

关键词

引用

@article{arxiv.2602.00927,
  title  = {Beyond What Seems Necessary: Hidden Gains from Scaling Training-Time Reasoning Length under Outcome Supervision},
  author = {Yihao Xue and Allan Zhang and Jianhao Huang and Amit Sahai and Baharan Mirzasoleiman},
  journal= {arXiv preprint arXiv:2602.00927},
  year   = {2026}
}