中文

基于AI反馈的多目标强化学习

机器学习 2024-06-13 v2

摘要

本文提出了多目标强化学习来自AI反馈(MORLAIF),这是一种改进使用强化学习来自AI反馈(RLAIF)训练的语言模型对齐和性能的方法。与标准方法不同的是,后者训练单个偏好模型来代表所有人类偏好,而MORLAIF将此任务分解为多个更简单的原则,如毒性、事实性和迎合性。针对每个原则使用来自GPT-3.5-Turbo的反馈训练独立的偏好模型。然后通过不同的标量化函数将这些偏好模型分数组合起来,为Proximal Policy Optimization(PPO)训练目标语言模型提供奖励信号。我们的实验表明,MORLAIF优于标准RLAIF基线,并且MORLAIF可用于使用更小的模型来对齐更大的语言模型。意外的是,标量化函数的选择似乎对结果影响不大。

关键词

引用

@article{arxiv.2406.07295,
  title  = {Multi-objective Reinforcement learning from AI Feedback},
  author = {Marcus Williams},
  journal= {arXiv preprint arXiv:2406.07295},
  year   = {2024}
}