中文

基于策略查询和主动学习的低成本代理奖励模型构建

机器学习 2024-07-10 v2 人工智能 计算与语言

摘要

基于人类反馈的强化学习(RLHF)是当前大型语言模型管道中广泛采用的方法,其瓶颈在于人类偏好数据的规模。虽然传统方法依赖离线偏好数据集构建,但近期方法转向在线设置,即学习者使用少量标记种子数据和大量未标记提示,通过自生成响应和高质量奖励/偏好反馈迭代构建新的偏好数据。然而,大多数当前的在线算法仍 focus on policy model updating during training with given feedback oracles,这会产生显著的专家查询成本。我们首次探索在极少标记数据和专家查询预算限制下构建低成本代理奖励 oracle 的策略。我们的 methods 引入两个关键创新:(1) 基于策略的查询以避免种子数据中的 OOD 和不平衡问题;(2) 主动学习选择最具信息量的数据进行偏好查询。通过这些方法,我们使用最小专家标记数据训练一个评估模型,该模型随后有效地为进一步的 RLHF 训练标记九倍以上的偏好对。例如,我们的方法在 AlpacaEval2、MMLU-5shot 和 MMLU-0shot 上平均提升约1%,仅需1700次查询成本。我们的 methodology 与其他直接专家查询-based 策略是正交的,因此可能集成以进一步降低查询成本。

关键词

引用

@article{arxiv.2407.02119,
  title  = {Cost-Effective Proxy Reward Model Construction with On-Policy and Active Learning},
  author = {Yifang Chen and Shuohang Wang and Ziyi Yang and Hiteshi Sharma and Nikos Karampatziakis and Donghan Yu and Kevin Jamieson and Simon Shaolei Du and Yelong Shen},
  journal= {arXiv preprint arXiv:2407.02119},
  year   = {2024}
}