中文

West-of-N:用于自我改进奖励模型的合成偏好

计算与语言 2024-10-28 v2 人工智能 机器学习

摘要

从人类反馈中进行强化学习(RLHF)在语言模型对齐中的成功,很大程度上取决于底层奖励模型的质量。在本文中,我们提出了一种通过生成合成偏好数据来提高奖励模型质量的新方法,从而用同策略的高质量偏好对来增强训练数据集。受Best-of-N采样策略在语言模型训练中取得的有希望结果的启发,我们将其应用扩展到奖励模型训练。这产生了一种自训练策略,通过从给定查询的响应池中选择最佳和最差的候选来生成偏好对。从经验上看,我们发现这种方法提高了任何奖励模型的性能,其效果与添加类似数量的人类偏好数据相当。这项工作通过提供合成偏好生成作为奖励建模挑战的解决方案,为改进用于语言模型对齐的RLHF开辟了新的研究途径。

关键词

引用

@article{arxiv.2401.12086,
  title  = {West-of-N: Synthetic Preferences for Self-Improving Reward Models},
  author = {Alizée Pace and Jonathan Mallinson and Eric Malmi and Sebastian Krause and Aliaksei Severyn},
  journal= {arXiv preprint arXiv:2401.12086},
  year   = {2024}
}