基于主动查询的从人类反馈中强化学习
机器学习
2025-02-12 v2 人工智能
计算与语言
最优化与控制
机器学习
摘要
使大型语言模型(LLM)与人类偏好对齐在构建现代生成模型中起着关键作用,可以通过从人类反馈中强化学习(RLHF)实现。尽管性能优越,当前的RLHF方法通常需要大量人工标注的偏好数据,这收集成本高昂。在本文中,受主动学习成功的启发,我们通过提出查询高效的RLHF方法来解决这个问题。我们首先将对齐问题形式化为上下文决斗赌博机问题,并设计了一种基于主动查询的近似策略优化(APPO)算法,具有的实例相关遗憾界和的查询复杂度,其中是特征空间维度,是所有上下文上的次优间隙。然后,我们提出了ADPO,这是我们算法基于直接偏好优化(DPO)的实用版本,并将其应用于微调LLM。我们的实验表明,ADPO在仅进行大约一半的人类偏好查询的情况下,与最先进的DPO方法性能相当。
引用
@article{arxiv.2402.09401,
title = {Reinforcement Learning from Human Feedback with Active Queries},
author = {Kaixuan Ji and Jiafan He and Quanquan Gu},
journal= {arXiv preprint arXiv:2402.09401},
year = {2025}
}
备注
28 pages, 1 figure, 4 table