中文

基于主动查询的从人类反馈中强化学习

机器学习 2025-02-12 v2 人工智能 计算与语言 最优化与控制 机器学习

摘要

使大型语言模型(LLM)与人类偏好对齐在构建现代生成模型中起着关键作用,可以通过从人类反馈中强化学习(RLHF)实现。尽管性能优越,当前的RLHF方法通常需要大量人工标注的偏好数据,这收集成本高昂。在本文中,受主动学习成功的启发,我们通过提出查询高效的RLHF方法来解决这个问题。我们首先将对齐问题形式化为上下文决斗赌博机问题,并设计了一种基于主动查询的近似策略优化(APPO)算法,具有O~(d2/Δ)\tilde{O}(d^2/\Delta)的实例相关遗憾界和O~(d2/Δ2)\tilde{O}(d^2/\Delta^2)的查询复杂度,其中dd是特征空间维度,Δ\Delta是所有上下文上的次优间隙。然后,我们提出了ADPO,这是我们算法基于直接偏好优化(DPO)的实用版本,并将其应用于微调LLM。我们的实验表明,ADPO在仅进行大约一半的人类偏好查询的情况下,与最先进的DPO方法性能相当。

关键词

引用

@article{arxiv.2402.09401,
  title  = {Reinforcement Learning from Human Feedback with Active Queries},
  author = {Kaixuan Ji and Jiafan He and Quanquan Gu},
  journal= {arXiv preprint arXiv:2402.09401},
  year   = {2025}
}

备注

28 pages, 1 figure, 4 table