EVPO:用于 LLM 后训练中自适应 Critic 利用的解释方差策略优化
机器学习
2026-04-22 v1 人工智能
计算与语言
摘要
用于 LLM 后训练的强化学习面临一个基本设计选择:是否使用学习到的 critic 作为策略优化的基线。经典理论倾向于基于 critic 的方法(如 PPO)以实现方差缩减,然而无 critic 的替代方案(如 GRPO)因其简单性和有竞争力的性能而获得了广泛采用。我们表明,在稀疏奖励设定下,学习到的 critic 可能注入估计噪声,且该噪声超过其捕获的状态信号,从而增加而非减少优势方差。通过将基线选择转化为 Kalman filtering 问题,我们将 PPO 和 GRPO 统一为 Kalman gain 的两个极端,并证明解释方差(Explained Variance, EV)——可从单个训练批次中计算得出——能够确定精确的边界:正的 EV 表明 critic 缩减了方差,而零或负的 EV 则表明其放大了方差。基于这一洞察,我们提出了解释方差策略优化(Explained Variance Policy Optimization, EVPO),它在每个训练步骤监控批次级 EV,并在基于 critic 的优势估计与批次均值优势估计之间自适应切换,可证明在每一步实现的方差均不大于两者中的较优者。在涵盖经典控制、智能体交互和数学推理的四个任务中,无论给定任务上哪个固定基线更强,EVPO 均始终优于 PPO 和 GRPO。进一步分析证实,自适应门控跟踪了训练过程中 critic 的成熟度,且理论推导的零阈值在经验上是最优的。
引用
@article{arxiv.2604.19485,
title = {EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training},
author = {Chengjun Pan and Shichun Liu and Jiahang Lin and Dingwei Zhu and Jiazheng Zhang and Shihan Dou and Songyang Gao and Zhenhua Han and Binghai Wang and Rui Zheng and Xuanjing Huang and Tao Gui and Yansong Feng},
journal= {arXiv preprint arXiv:2604.19485},
year = {2026}
}