中文

基于结果的强化学习可证明地引导 Transformer 进行推理,但仅限于使用正确的数据

机器学习 2026-02-03 v3 人工智能

摘要

通过带有基于结果监督的强化学习 (RL) 训练的 Transformer 能够自发地产生生成中间推理步骤 (Chain-of-Thought) 的能力。然而,稀疏奖励驱动策略梯度发现此类系统性推理的机制仍不清楚。我们通过分析单层 Transformer 在合成图遍历任务上的策略梯度动力学来解决这一问题,该任务不使用 Chain-of-Thought 就无法解决,但存在简单的迭代解法。我们证明,尽管仅根据最终答案的正确性进行训练,策略梯度仍能驱动 Transformer 收敛到一种结构化、可解释的算法,该算法逐顶点地迭代遍历图。我们刻画了这种涌现所需的分布特性,识别出“简单示例”的关键作用:即需要较少推理步骤的实例。当训练分布在这些更简单的示例上放置足够的质量时,Transformer 会学习到一种可泛化的遍历策略,并能够外推到更长的链;当该质量消失时,策略梯度学习变得不可行。我们通过在合成数据上的实验以及在数学推理任务上使用真实世界语言模型的实验,证实了我们的理论结果,验证了我们的理论发现可适用于实际环境。

关键词

引用

@article{arxiv.2601.15158,
  title  = {Outcome-Based RL Provably Leads Transformers to Reason, but Only With the Right Data},
  author = {Yuval Ran-Milo and Yotam Alexander and Shahar Mendel and Nadav Cohen},
  journal= {arXiv preprint arXiv:2601.15158},
  year   = {2026}
}

备注

87 pages, 6 figures