中文

将价值模型拉回:面向LLM强化学习的生成式批评家

机器学习 2026-04-14 v1 人工智能 计算与语言

摘要

信用分配是强化学习(RL)中的核心挑战。经典的演员-评论家方法通过基于所学习价值函数的细粒度优势估计来解决这一挑战。然而,由于传统判别式批评家难以可靠训练,所学价值模型常被避免在现代大型语言模型(LLM)RL中。我们重新审视价值建模,认为此困难部分源于表达复杂度的限制。特别是,表征复杂度理论表明,在现有价值模型所使用的单次预测范式下,价值函数可能难以近似,且我们的扩展实验显示,这类批评家随规模增长并不一定可靠地获得改进。为此,我们提出生成式演员-批评家(GenAC),其用链律推理取代单次标量价值预测。我们进一步引入In-Context Conditioning,帮助批评家在整个训练期间保持对当前演员的校准。GenAC改进了价值近似、排序可靠性和跨分布 generalization,并这些收益转化为强于基于价值和无价值基线的更强下游RL性能。总体而言,我们的结果表明,更强的价值建模是改进LLM强化学习中信用分配的有前景的方向。

关键词

引用

@article{arxiv.2604.10701,
  title  = {Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning},
  author = {Zikang Shan and Han Zhong and Liwei Wang and Li Zhao},
  journal= {arXiv preprint arXiv:2604.10701},
  year   = {2026}
}

备注

16 pages including appendix, 4 figures