链路思考下的基于链式思维的强化学习
机器学习
2026-05-11 v1
摘要
在上下文中进行强化学习(ICRL)指的是在推理时刻无需参数更新即可适应新任务,通过对额外上下文进行条件化来实现。最近的实证研究进一步表明,链式思考(CoT)生成可以放大这种ICRL能力。本文是首次对CoT如何与ICRL交互提供理论理解。我们在线性变换器的策略评估设置下进行分析。我们证明,在特定的变换器参数下,CoT生成过程等价于反复执行时序差分学习更新。此外,我们提供了有限样本收敛分析,表明策略评估误差随着CoT长度的增加而几何级数减小,最终在由上下文长度决定的统计底层处于饱和。我们还证明,所需的变换器参数是预训练损失的全局最小化器,为对这些参数的经验性出现提供了理论理解。
引用
@article{arxiv.2605.07123,
title = {Convergence and Emergence of In-Context Reinforcement Learning with Chain of Thought},
author = {Zixuan Xie and Xinyu Liu and Rohan Chandra and Shangtong Zhang},
journal= {arXiv preprint arXiv:2605.07123},
year = {2026}
}