中文

双倍思考不如一:基于协作奖励建模的 LLM 对齐方法

机器学习 2025-05-20 v2 人工智能 计算与语言

摘要

奖励模型(RM)在与人类价值观一致地对齐大语言模型(LLMs)方面起着关键作用。然而,人类反馈中的噪声偏好可能导致奖励模型产生误概括——即奖励模型学习虚假关联或对噪声偏好过拟合,这对奖励模型的概括性提出了重要挑战。本文系统性地分析了偏好对的特征,旨在识别噪声偏好与人类对齐偏好在奖励建模中的差异。我们的分析表明,噪声偏好对 RMs 来说难以拟合,因为它们会导致训练时的剧烈波动和不规则的梯度更新。这些独特的动态特征表明,通过识别和排除此类噪声偏好是可行的。实证研究表明,使用包含大量噪声的完整偏好数据集训练的策略 LLM 执行得比仅使用高质量偏好子集训练的 LLM 差。为此,我们提出了一种在线协作式奖励建模(CRM)框架,通过同行评审和课程学习实现稳健的偏好学习。具体而言,CRM 维护两个 RMs,通过相互同行评审筛选潜在的噪声偏好。课程学习同步两个模型的能力,缓解过度的差异,以促进同行评审的实用性。广泛的实验表明,CRM 在奖励建模中显著提升了概括能力,在 40% 极端噪声情况下,在 RewardBench 上提升最高可达 9.94 分。此外,CRM 可以无缝扩展到隐式奖励对齐方法,提供一种稳健且通用的对齐策略。

关键词

引用

@article{arxiv.2505.10597,
  title  = {Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment},
  author = {Jiazheng Zhang and Wenqing Jing and Zizhuo Zhang and Zhiheng Xi and Shihan Dou and Rongxiang Weng and Jiahuan Li and Jingang Wang and Mingxu Chai and Shibo Hong and Tao Gui and Qi Zhang},
  journal= {arXiv preprint arXiv:2505.10597},
  year   = {2025}
}