中文

完美融合:通过判官混合模型重新定义 RLHF

机器学习 2024-10-01 v1 人工智能 计算与语言

摘要

强化学习从人类反馈(RLHF)已成为微调大型语言模型(LLM)的主要方法。然而,RLHF 在多任务学习(MTL)中存在局限,主要源于奖励欺骗和极端多目标优化(即多个或某些可能冲突目标之间的权衡)的挑战。目前将 RLHF 应用于 MTL 需要精细调节奖励模型和数据组合的权重。这通常依赖人类直觉,难以泛化。在本工作中,我们引入了一种新颖的后训练范式,称为受约束生成策略优化(Constrained Generative Policy Optimization, CGPO)。CGPO 的核心是判官混合模型(Mixture of Judges, MoJ),结合了分层约束策略优化,能够以原则方式识别 RLHF 中的完美融合。该方法在理论上具有强大的保证,不需要 extensive 超参数调优,且可即插即用于常见的后训练管道中。总体而言,CGPO 能检测并缓解奖励欺骗行为,同时在极大目标数量下达到帕累托最优点。我们的实验结果表明,CGPO 在包括常规聊天、STEM 问题、指令遵循和编码等多个任务上,显著优于 PPO 和 DPO 等标准 RLHF 算法。具体而言,CGPO 在 AlpacaEval-2(常规聊天)上提升了 7.4%,在 Arena-Hard(STEM 与推理)上提升了 12.5%,并在其他领域如数学和编码中持续获益。值得注意的是,尽管 PPO 在流行的编码基准中被广泛使用,但容易出现严重的奖励欺骗,而 CGPO 成功地解决了这一问题。本次 RLHF 的突破性进展不仅解决了奖励欺骗和极端多目标优化的挑战,还推动了通用 LLM 在多样化应用中的对齐技术的前沿水平。

关键词

引用

@article{arxiv.2409.20370,
  title  = {The Perfect Blend: Redefining RLHF with Mixture of Judges},
  author = {Tengyu Xu and Eryk Helenowski and Karthik Abinav Sankararaman and Di Jin and Kaiyan Peng and Eric Han and Shaoliang Nie and Chen Zhu and Hejia Zhang and Wenxuan Zhou and Zhouhao Zeng and Yun He and Karishma Mandyam and Arya Talabzadeh and Madian Khabsa and Gabriel Cohen and Yuandong Tian and Hao Ma and Sinong Wang and Han Fang},
  journal= {arXiv preprint arXiv:2409.20370},
  year   = {2024}
}

备注

submitted to conference