中文

基于信息导向抽样的样本高效强化学习从人类反馈

机器学习 2025-08-11 v3

摘要

我们从理论角度研究了强化学习从人类反馈(RLHF)这一问题,这是训练大型语言模型中的关键问题。我们的主要贡献是设计基于信息导向抽样(IDS)的 novel 样本高效 RLHF 算法,这种算法是受信息论启发的在线决策原则。我们的算法最大化价值函数与互信息项之和,这一互信息项鼓励探索未知环境(即通过观察的人类反馈数据量化获取关于环境的信息)。为解决大状态空间和提高样本效率的挑战,我们构建了一个简化的“替代环境”,并引入一种新颖的距离度量(称为“g\ell_g距离”),使基于 IDS 的算法能够实现 Bayesian 后悔上界为 O(H32log(K(ϵ))T)O(H^{\frac{3}{2}}\sqrt{\log(K(\epsilon)) T}) 的阶数,其中 HH 为剧集长度,TT 为剧集数量,K(ϵ)K(\epsilon) 与环境的覆盖数相关。在表格设置下,此后悔上界的阶数为 O~(H2SAT)\tilde{O}(H^2\sqrt{SAT}),其中 SSAA 分别为状态数和动作数。最后,我们提出了一个近似 IDS 算法,在保持近乎相同样本效率的同时具有更高的计算效率。该近似算法的设计原则不仅在 RLHF 场景下有效,也适用于标准强化学习框架。此外,我们的工作展示了信息论在强化学习和大型语言模型训练中的价值。

关键词

引用

@article{arxiv.2502.05434,
  title  = {Sample-Efficient Reinforcement Learning from Human Feedback via Information-Directed Sampling},
  author = {Han Qi and Haochen Yang and Qiaosheng Zhang and Zhuoran Yang},
  journal= {arXiv preprint arXiv:2502.05434},
  year   = {2025}
}