SALMON:基于可指令化奖励模型的自我对齐
计算与语言
2024-04-11 v2 人工智能
机器学习
摘要
在响应示范上进行监督微调(SFT)并结合来自人类反馈的强化学习(RLHF)构成了对齐基于 LLM 的 AI 智能体的强大范式。然而,这种方法的一个显著局限是其对高质量人类标注的依赖,由于难以获得一致的响应示范以及分布内响应偏好,使其应用于复杂任务时面临挑战。本文提出一种新方法,即 SALMON,以极少的人类监督对齐基础语言模型,仅使用一小组人类定义的准则,却实现了优越性能。我们方法的核心是一个可指令化奖励模型。该模型在合成偏好数据上训练,能够基于任意人类定义的准则生成奖励分数。通过在 RL 训练阶段仅调整这些准则,我们借助可指令化奖励模型完全控制偏好,进而影响经 RL 训练的策略模型的行为,并减少对在线人类偏好收集的依赖。将我们的方法应用于 LLaMA-2-70b 基础语言模型,我们开发了名为 Dromedary-2 的 AI 助手。仅使用 6 个用于上下文学习的示例和 31 条人类定义的准则,Dromedary-2 在多个基准数据集上显著超越包括 LLaMA-2-Chat-70b 在内的若干最先进 AI 系统。我们已开源代码和模型权重,以鼓励进一步研究如何以更高的监督效率、更好的可控性和可扩展的监督来对齐基于 LLM 的 AI 智能体。
引用
@article{arxiv.2310.05910,
title = {SALMON: Self-Alignment with Instructable Reward Models},
author = {Zhiqing Sun and Yikang Shen and Hongxin Zhang and Qinhong Zhou and Zhenfang Chen and David Cox and Yiming Yang and Chuang Gan},
journal= {arXiv preprint arXiv:2310.05910},
year = {2024}
}
备注
Previous Title: SALMON: Self-Alignment with Principle-Following Reward Models. Accepted to ICLR 2024. Project page: https://github.com/IBM/SALMON