中文

RRHF:无需繁琐即可通过排序响应以人类反馈对齐语言模型

计算与语言 2023-10-10 v3

摘要

基于人类反馈的强化学习(RLHF)促进了大语言模型与人类偏好的对齐,显著提升了人与模型交互的质量。InstructGPT 通过多个阶段实现 RLHF,包括监督微调(SFT)、奖励模型训练和近端策略优化(PPO)。然而,PPO 对超参数敏感,且其标准实现需要多个模型,难以训练并扩展到更大的参数量。相比之下,我们提出了一种称为 RRHF 的新颖学习范式,它通过条件概率的对数对不同来源的采样响应进行打分,并通过排序损失学习将这些概率与人类偏好对齐。RRHF 可以利用来自多种来源的采样响应,包括模型自身的响应、其他大语言模型的响应以及人类专家响应,来学习对它们进行排序。RRHF 在调优期间仅需 1 到 2 个模型,并且能够高效、鲁棒地以人类偏好对齐语言模型,无需复杂的超参数调优。此外,RRHF 可被视为 SFT 和奖励模型训练的扩展,同时在代码、模型数量和超参数方面比 PPO 更简单。我们在 Helpful and Harmless 数据集上评估 RRHF,通过奖励模型分数和人工标注展示了与 PPO 相当的对齐性能。大量实验表明,RRHF 的性能与采样质量高度相关,这表明 RRHF 是一个 best-of-n 学习器。代码见 https://github.com/GanjinZero/RRHF。

关键词

引用

@article{arxiv.2304.05302,
  title  = {RRHF: Rank Responses to Align Language Models with Human Feedback without tears},
  author = {Zheng Yuan and Hongyi Yuan and Chuanqi Tan and Wei Wang and Songfang Huang and Fei Huang},
  journal= {arXiv preprint arXiv:2304.05302},
  year   = {2023}
}

备注

ArXiv version For NeurIPS 2023 accepted paper: RRHF: Rank Responses to Align Language Models with Human Feedback