基于AI反馈的多目标强化学习
机器学习
2024-06-13 v2
摘要
本文提出了多目标强化学习来自AI反馈(MORLAIF),这是一种改进使用强化学习来自AI反馈(RLAIF)训练的语言模型对齐和性能的方法。与标准方法不同的是,后者训练单个偏好模型来代表所有人类偏好,而MORLAIF将此任务分解为多个更简单的原则,如毒性、事实性和迎合性。针对每个原则使用来自GPT-3.5-Turbo的反馈训练独立的偏好模型。然后通过不同的标量化函数将这些偏好模型分数组合起来,为Proximal Policy Optimization(PPO)训练目标语言模型提供奖励信号。我们的实验表明,MORLAIF优于标准RLAIF基线,并且MORLAIF可用于使用更小的模型来对齐更大的语言模型。意外的是,标量化函数的选择似乎对结果影响不大。
引用
@article{arxiv.2406.07295,
title = {Multi-objective Reinforcement learning from AI Feedback},
author = {Marcus Williams},
journal= {arXiv preprint arXiv:2406.07295},
year = {2024}
}