中文

大语言模型的基于值函数的离线强化学习

机器学习 2026-03-25 v1 计算与语言

摘要

提高数据利用效率对于扩展强化学习(RL)以处理生成轨迹代价高昂的长时序任务至关重要。然而,面向大语言模型(LLM)的主流RL方法大多是在线策略(on-policy)的:每批数据仅更新一次即丢弃,然后收集新样本,导致样本效率低下。本工作探索了一种面向LLM的替代性基于值函数的RL框架,自然支持离线策略学习。我们提出ReVal,一种基于Bellman更新的方法,结合了捕捉内部一致性的逐步信号与源自结果验证的轨迹级信号。ReVal天然支持基于回放缓冲区的训练,允许高效复用历史轨迹。在标准数学推理基准上的实验表明,ReVal不仅收敛更快,而且在最终性能上优于GRPO。在DeepSeek-R1-Distill-1.5B上,ReVal提升了训练效率,在AIME24上相比GRPO提升2.7%,在域外基准GPQA上提升4.5%。这些结果表明,基于值函数的RL是LLM训练中策略基方法的一种实用替代方案。

关键词

引用

@article{arxiv.2603.23355,
  title  = {Off-Policy Value-Based Reinforcement Learning for Large Language Models},
  author = {Peng-Yuan Wang and Ziniu Li and Tian Xu and Bohan Yang and Tian-Shuo Liu and ChenYang Wang and Xiong-Hui Chen and Yi-Chen Li and Tianyun Yang and Congliang Chen and Yang Yu},
  journal= {arXiv preprint arXiv:2603.23355},
  year   = {2026}
}