预训练价值,而非奖励:解耦价值策略优化
机器学习
2026-01-27 v2 人工智能
摘要
在本文中,我们探讨了直接预训练价值模型如何简化并稳定人类反馈强化学习(RLHF)。在强化学习中,价值估计是策略优化的关键,不同于奖励监督。价值函数预测部分答案的\emph{return-to-go},即如果该部分答案继续完成,它有多大前景。然而,在RLHF中,标准流程首先预训练一个奖励模型,然后在线学习价值函数,尽管一旦收集了偏好数据就不再有新的奖励信号可用。这使得评论家学习变得冗余,因为训练奖励模型然后推导价值模型的过程在信息上等价于直接预训练价值模型。重要的是,这不需要额外的监督,我们的价值模型完全在用于奖励建模的相同数据上进行训练。基于这一见解,我们引入了\emph{解耦价值策略优化}(DVPO),这是一个离线预训练\emph{全局价值模型}(GVM)并将其冻结作为策略学习的通用评论家的框架。GVM提供稳定、细粒度的信用分配,而不会出现评论家漂移或轨迹采样。在MT-Bench、Alpaca-Eval和Arena-Hard上的实验表明,DVPO匹配或超越了最先进的RLHF方法。这些结果强调,RLHF可以被重新构建为由单一预训练价值模型指导的纯策略优化。
引用
@article{arxiv.2502.16944,
title = {Pretrain Value, Not Reward: Decoupled Value Policy Optimization},
author = {Chenghua Huang and Lu Wang and Fangkai Yang and Pu Zhao and Zhixu Li and Qingwei Lin and Dongmei Zhang and Saravan Rajmohan and Qi Zhang},
journal= {arXiv preprint arXiv:2502.16944},
year = {2026}
}
备注
16 pages, 3 figures