中文

RLHF 中探索驱动的策略优化:高效数据利用的理论见解

机器学习 2024-07-16 v2 人工智能 计算与语言

摘要

基于人类反馈的强化学习(RLHF)在仅依赖少量人类反馈的情况下取得了令人印象深刻的实证成功。然而,这种现象缺乏有限的理论依据。此外,尽管基于策略的算法最近取得了实证成功,但大多数近期研究仍集中于基于价值的算法。在本工作中,我们考虑一种基于策略优化(PO-RLHF)的 RLHF 算法。该算法基于流行的策略覆盖 - 策略梯度(PC-PG)算法,后者假设已知奖励函数。在 PO-RLHF 中,不假设已知奖励函数,算法利用基于轨迹的比较反馈来推断奖励函数。我们为具有低查询复杂度的 PO-RLHF 提供了性能界限,这为为何少量人类反馈可能足以在 RLHF 中实现良好性能提供了见解。一个关键创新是轨迹级椭圆势分析,它在给定比较反馈(而非数值奖励观测)时限制了奖励估计误差。我们提供并分析了针对线性和神经函数近似两种设置的 PG-RLHF 和 NN-PG-RLHF 算法。

关键词

引用

@article{arxiv.2402.10342,
  title  = {Exploration-Driven Policy Optimization in RLHF: Theoretical Insights on Efficient Data Utilization},
  author = {Yihan Du and Anna Winnicki and Gal Dalal and Shie Mannor and R. Srikant},
  journal= {arXiv preprint arXiv:2402.10342},
  year   = {2024}
}