基于人类反馈的强化学习双向主动学习
机器学习
2025-01-03 v2 机器学习
摘要
与人类偏好一致的大型语言模型(LLM)是近期生成式人工智能进步的关键。强化学习从人类反馈(RLHF)被广泛应用于实现这一目标。在 RLHF 中,一个关键步骤是从人类反馈中学习奖励函数。然而,人类反馈成本高昂且耗时,使得收集高质量对话数据供人类教师标注变得至关重要。此外,不同的人类教师具有不同的专业水平,因此,针对不同教师查询其意见的选择性至关重要。本文我们使用离线强化学习(RL)来构建这个对齐问题。受 -最优设计的启发,我们首先提出了一种双向主动奖励学习算法,用于同时选择对话和教师。接下来,我们应用悲观 RL 来解决对齐问题,基于所学的奖励估计器。理论上,我们展示,通过我们提出的自适应选择策略获得的奖励估计器在渐近上实现最小的广义方差,并证明我们的悲观策略的亚最优性随给定样本预算 的 规模。通过仿真和在 LLM 上的实验,我们展示了该算法的有效性以及其相对于最先进方法的优势。
引用
@article{arxiv.2410.02504,
title = {Dual Active Learning for Reinforcement Learning from Human Feedback},
author = {Pangpang Liu and Chengchun Shi and Will Wei Sun},
journal= {arXiv preprint arXiv:2410.02504},
year = {2025}
}