中文

轨迹 Bellman 残差最小化:一种用于 LLM 推理的简单基于价值的方法

机器学习 2025-11-13 v2 人工智能 计算与语言

摘要

当前,基于策略的方法主导大型语言模型(LLM)推理的强化学习(RL)管道,价值方法鲁亏未被充分探索。我们重新审视经典的 Bellman 残差最小化范式,引入轨迹 Bellman 残差最小化(TBRM),该算法自然地将这一想法适用于 LLM,生成一种简单而有效的离策略算法,通过使用模型自身的 logits 作为 QQ 值优化单个轨迹级别的 Bellman 目标。TBRM 省去了评论家、重要性抽样比率或裁剪的需求,仅需每个提示一个 rollout。我们通过改进的轨迹度量分析证明了从任意离策略数据收敛到接近最优 KL-正则化策略。在标准数学推理基准测试上进行实验,显示 TBRM 在 PPO 和 GRPO 等基于策略的基线上持续表现更好,同时计算和内存开销可比。我们的結果表明,基于价值的 RL 可能是增强 LLM 推理能力的原则且有效的替代方法。

关键词

引用

@article{arxiv.2505.15311,
  title  = {Trajectory Bellman Residual Minimization: A Simple Value-Based Method for LLM Reasoning},
  author = {Yurun Yuan and Fan Chen and Zeyu Jia and Alexander Rakhlin and Tengyang Xie},
  journal= {arXiv preprint arXiv:2505.15311},
  year   = {2025}
}

备注

NeurIPS 2025