中文

用于RLHF奖励模型去噪的策略过滤

机器学习 2025-06-10 v5 人工智能

摘要

尽管存在直接的策略优化方法,但新兴的大语言模型(LLM)是通过强化学习从人类反馈(RLHF)进行微调的,以在来自偏好数据的奖励模型监督下生成更好的响应。RLHF的主要挑战在于奖励模型的不准确,尤其是在需要奖励模型对响应进行复杂推理评分的任务中。我们发现,奖励模型的可靠性在不同奖励值分配的响应之间存在差异。这激励我们过滤可能不可靠的奖励样本,以提高策略学习中的信噪比, resulting in Policy Filtration for Proximal Policy Optimization(PF-PPO)。为了选择合适的策略过滤方案,我们使用奖励与实际得分在过滤样本上的决定系数(R2)作为指标,以帮助我们找到有前景的方案。我们进行了大量实验以验证PF-PPO在代码生成和数学推理任务中的有效性。在代码生成方面,PF-PPO在HumanEval(+7.9%)、MBPP(+0.7%)和LeetCode Contest(+10.0%)上实现了70亿参数模型的最先进性能,这是一个由我们创建的更具挑战性的基准。在数学推理中,PF-PPO在不同奖励模型和基准(Ape210K和CMATH)上均实现了性能提升。代码已发布于https://github.com/DtYXs/verl/tree/pf-ppo。

关键词

引用

@article{arxiv.2409.06957,
  title  = {Policy Filtration for RLHF to Mitigate Noise in Reward Models},
  author = {Chuheng Zhang and Wei Shen and Li Zhao and Xuyun Zhang and Xiaolong Xu and Wanchun Dou and Jiang Bian},
  journal= {arXiv preprint arXiv:2409.06957},
  year   = {2025}
}

备注

ICML2025