关注过程而非结果:通过奖励潜在思想轨迹提升循环语言模型的推理能力
机器学习
2026-05-29 v3
摘要
循环语言模型(LoopLMs)在生成 token 之前执行多步潜在推理,在较小的参数预算下在推理基准测试中超越传统大语言模型。然而,尝试通过强化学习进一步提升 LoopLM 推理能力的尝试失败了——标准目标如群相对政策优化(GRPO)仅对最终潜在状态分配信用,导致与模型内部计算之间的根本性不匹配。为解决此问题,我们引入了 RLTT(Reward Latent Thought Trajectories),一种在完整潜在推理轨迹上分布奖励的强化学习框架。RLTT 在不依赖外部验证器的情况下提供稠密的轨迹级信用分配,可以直接替换 GRPO 而几乎没有额外开销。在在 Ouro-1.4B/2.6B-Thinking 进行大量实验后,RLTT 在挑战性数学推理基准测试中显著优于 GRPO,在 1.4B 规模上对 MATH-500、AIME24/26 和 BeyondAIME 的平均准确率提升了 +5.8%,在 2.6B 规模上提升了 +10.9%。尽管仅在数学领域训练,RLTT 也能有效地迁移到非数学推理基准测试,表明在 LoopLMs 中进行轨迹级信用分配对强化学习的有效性。代码可在 https://github.com/jonwill8/RLTT.git 获取。
引用
@article{arxiv.2602.10520,
title = {Prioritize the Process, Not Just the Outcome: Rewarding Latent Thought Trajectories Improves Reasoning in Looped Language Models},
author = {Jonathan Williams and Esin Tureci},
journal= {arXiv preprint arXiv:2602.10520},
year = {2026}
}
备注
ICML 2026