中文

批判式声部奖励模型

机器学习 2024-08-22 v1

摘要

传统上,用于强化学习从人类反馈(RLHF)的奖励模型旨在直接预测偏好分数,却未充分利用底层大语言模型(LLM)的生成能力。这限制了奖励模型的性能,因其必须在单次前向传播中隐式推理响应质量,即偏好建模受限于单一路径。为使奖励模型能够显式推理响应质量,我们提出了批判式声部(Critique-out-Loud, CLoud)奖励模型。CLoud 奖励模型首先生成对助手响应的自然语言批判,然后据此预测响应质量的标量奖励。我们在 Llama-3-8B 和 70B 基础模型上证明了 CLoud 奖励模型的有效性:相较于经典奖励模型,CLoud 奖励模型在 RewardBench 上的两两偏好分类准确率分别提高了 4.65 和 5.84 个百分点。此外,CLoud 奖励模型在 ArenaHard 上用于 Best-of-N 评分模型时,实现了获胜率的 Pareto 改进。最后,我们探讨如何利用 CLoud 奖励模型的动态推理计算能力,通过自我一致性解码进行奖励预测。

关键词

引用

@article{arxiv.2408.11791,
  title  = {Critique-out-Loud Reward Models},
  author = {Zachary Ankner and Mansheej Paul and Brandon Cui and Jonathan D. Chang and Prithviraj Ammanabrolu},
  journal= {arXiv preprint arXiv:2408.11791},
  year   = {2024}
}