基于信息导向抽样的样本高效强化学习从人类反馈
机器学习
2025-08-11 v3
摘要
我们从理论角度研究了强化学习从人类反馈(RLHF)这一问题,这是训练大型语言模型中的关键问题。我们的主要贡献是设计基于信息导向抽样(IDS)的 novel 样本高效 RLHF 算法,这种算法是受信息论启发的在线决策原则。我们的算法最大化价值函数与互信息项之和,这一互信息项鼓励探索未知环境(即通过观察的人类反馈数据量化获取关于环境的信息)。为解决大状态空间和提高样本效率的挑战,我们构建了一个简化的“替代环境”,并引入一种新颖的距离度量(称为“距离”),使基于 IDS 的算法能够实现 Bayesian 后悔上界为 的阶数,其中 为剧集长度, 为剧集数量, 与环境的覆盖数相关。在表格设置下,此后悔上界的阶数为 ,其中 和 分别为状态数和动作数。最后,我们提出了一个近似 IDS 算法,在保持近乎相同样本效率的同时具有更高的计算效率。该近似算法的设计原则不仅在 RLHF 场景下有效,也适用于标准强化学习框架。此外,我们的工作展示了信息论在强化学习和大型语言模型训练中的价值。
引用
@article{arxiv.2502.05434,
title = {Sample-Efficient Reinforcement Learning from Human Feedback via Information-Directed Sampling},
author = {Han Qi and Haochen Yang and Qiaosheng Zhang and Zhuoran Yang},
journal= {arXiv preprint arXiv:2502.05434},
year = {2025}
}