中文

面向 RLHF 的统一成对框架:桥接生成式奖励建模与策略优化

机器学习 2025-04-08 v1

摘要

基于人类反馈的强化学习(RLHF)已成为在后训练阶段使大型语言模型(LLM)与人类偏好对齐的重要范式。该框架通常包含两个阶段:首先在人类偏好数据上训练奖励模型,随后使用强化学习算法优化语言模型。然而,当前的 RLHF 方法可能受到两个局限性的制约。首先,现有的 RLHF 框架通常依赖 Bradley-Terry 模型基于对单个响应的成对比较来分配标量奖励。然而,这种方法给奖励模型(RM)带来了巨大挑战,因为不同上下文中提示-响应对的固有变异性要求 RM 具备稳健的校准能力。其次,奖励模型通常从生成式基础模型(如预训练或监督微调模型)初始化,尽管奖励模型执行的是判别性任务,这造成了不匹配。本文引入了 Pairwise-RL,这是一个 RLHF 框架,通过结合生成式奖励建模和成对近端策略优化(PPO)算法来解决这些挑战。Pairwise-RL 在一致的成对范式内统一了奖励模型训练及其在强化学习中的应用,利用生成式建模技术来增强奖励模型性能和分数校准。实验评估表明,Pairwise-RL 在内部评估数据集和标准公共基准上均优于传统 RLHF 框架,凸显了其在改善对齐和模型行为方面的有效性。

关键词

引用

@article{arxiv.2504.04950,
  title  = {A Unified Pairwise Framework for RLHF: Bridging Generative Reward Modeling and Policy Optimization},
  author = {Wenyuan Xu and Xiaochen Zuo and Chao Xin and Yu Yue and Lin Yan and Yonghui Wu},
  journal= {arXiv preprint arXiv:2504.04950},
  year   = {2025}
}

备注

11oages,2 figures