REINFORCE++:通过全局优势归一化稳定无评论家策略优化
计算与语言
2025-11-11 v9 机器学习
摘要
基于人类反馈的强化学习~(RLHF) 在对齐大型语言模型~(LLM) 中发挥着至关重要的作用。主流算法近端策略优化~(PPO) 采用评论家网络来估计优势,这引入了显著的计算和内存开销。为了解决这个问题,出现了一系列无评论家算法(如 GRPO、RLOO)。然而,这些方法通常依赖于\textit{提示级(局部)}优势归一化,这存在优势估计不准确、容易过拟合的问题,并且如我们所展示的,它是一个理论上存在偏差的估计量。为了解决这些挑战,我们引入了 REINFORCE++,一个以\textbf{全局优势归一化}为核心的无评论家框架。通过在整个全局批次而非小的特定提示组内对优势进行归一化,我们的方法提供了一个更稳定且理论上可靠的\textit{有效无偏}估计(其偏差随批次大小增加而消失)。我们引入了两个变体:REINFORCE++,一种用于通用领域 RLHF 的高效通用算法();以及 REINFORCE++ /w baseline,一种用于复杂推理任务的稳健组采样变体()。我们的实证评估表明,每个变体在其各自领域都展现出卓越的稳定性和性能,优于现有方法,甚至在复杂的智能体设定中超越了 PPO。
引用
@article{arxiv.2501.03262,
title = {REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization},
author = {Jian Hu and Jason Klein Liu and Haotian Xu and Wei Shen},
journal= {arXiv preprint arXiv:2501.03262},
year = {2025}
}
备注
refactor