中文

RL用于大语言模型的值梯度假设

机器学习 2026-05-22 v1 人工智能 计算与语言

摘要

强化学习显著提升了预训练语言模型,但为何无批评方法(如PPO和GRPO)表现如此佳,以及何时才能提供最大收益,仍未得到充分研究。我们发展了针对大语言模型后训练中无批评强化学习的值梯度视角。首先,在可微分 rollout 和加性噪声参数化下,我们证明演员更新在期望意义上类似于值梯度:反向传播传递的代数,其条件期望等于值梯度。其次,对于离散变换器策略,我们证明通过注意力实现的自动微分产生的经验代数近似于该值信号,其误差由抽样间隙和策略熵控制。这些结果激发我们将RL影响分解为值梯度信号和可达奖励头室,给出何时应在预训练轨迹上最有效的准则。

关键词

引用

@article{arxiv.2605.21654,
  title  = {Value-Gradient Hypothesis of RL for LLMs},
  author = {Arip Asadulaev and Daniil Ognev and Karim Salta and Martin Takac},
  journal= {arXiv preprint arXiv:2605.21654},
  year   = {2026}
}