中文

奖励就足够:大型语言模型是情境强化学习者

机器学习 2026-04-28 v6 人工智能 计算与语言

摘要

强化学习 (RL) 是解决序列决策问题的框架。本文演示了一种令人惊讶的现象:在大型语言模型 (LLM) 的推理过程中,RL 似乎正在发生,我们将其称为情境强化学习 (ICRL)。为揭示这一能力,本文引入一种简单的多轮提示框架,称为 ICRL 提示方法,以实现推理过程中的自我改进。ICRL 提示的目标是引导 LLM 在给定任务的推理中进行强化学习,以实现自我提升。每轮响应后,模型会接收到表示奖励的标量数值反馈。在下一轮中,我们将 LLM 再次提示,并附上包含所有 prior 响应及其相关奖励的上下文。我们一致观察到,随着上下文的增长,响应质量不断提高。也就是说,LLM 能够在推理过程中优化标量奖励信号,展现出类似强化学习的行为。我们在 Game of 24、创意写作、ScienceWorld 以及奥林匹克水平的数学竞赛 (AIME 和 HMMT) 上评估了 ICRL 提示方法,显著优于 Self-Refine 和 Reflexion 等基线方法。值得注意的是,即使奖励信号由相同的 LLM 生成,ICRL 提示方法仍能提升性能,这凸显了一种值得期待的测试时间扩展范式。

关键词

引用

@article{arxiv.2506.06303,
  title  = {Reward Is Enough: LLMs Are In-Context Reinforcement Learners},
  author = {Kefan Song and Amir Moeini and Peng Wang and Lei Gong and Rohan Chandra and Shangtong Zhang and Yanjun Qi},
  journal= {arXiv preprint arXiv:2506.06303},
  year   = {2026}
}