无奖励推断的人类反馈强化学习:模型无关算法与实例相关分析
机器学习
2025-01-22 v2 机器学习
摘要
本文研究在具有一般轨迹奖励模型的马尔可夫决策过程(MDP)下的强化学习从人类反馈(RLHF)。我们开发了一种无显式奖励模型推断(是当代训练大型语言模型(LLM)的 RLHF 范式中关键的中间步骤)的模型无关 RLHF 最佳策略识别算法,称为 。该算法通过反向方式从人类偏好信息中直接识别最优策略,采用 dueling bandit 子程序持续对比动作以识别优劣。 采用奖励无关的探索和类似最佳臂识别的自适应停止准则,在所有处于相同决策步骤的状态之间的访问次数相等的同时,一旦最优动作可被识别,即回退至前一步,导致可证明的、实例相关的样本复杂度 ,其中 为实例相关常数, 为批量大小。此外, 可转化为具有对数 regret 的 explore-then-commit 算法,并可通过基于帧的方法推广到折扣 MDP。我们的结果表明:(i)在样本复杂度方面,RLHF 不比经典 RL 难得多;(ii)端到端 RLHF 可能通过避免奖励推断中的诸多陷阱(如过拟合和分布漂移),实现更好的性能。
引用
@article{arxiv.2406.07455,
title = {Reinforcement Learning from Human Feedback without Reward Inference: Model-Free Algorithm and Instance-Dependent Analysis},
author = {Qining Zhang and Honghao Wei and Lei Ying},
journal= {arXiv preprint arXiv:2406.07455},
year = {2025}
}