中文

基于人类反馈的在线强化学习的数据依赖探索

机器学习 2026-05-07 v1

摘要

基于人类反馈的在线强化学习(RLHF)通过在训练过程中持续收集新的偏好反馈,已成为对齐大语言模型(LLMs)的一种极具前景的范式。该场景中的一个基础挑战是探索,它要求算法使LLM能够生成信息丰富的比较,从而提升在线RLHF的样本效率。现有的探索策略通常通过策略期望推导奖励,这在训练期间可用的有限历史偏好数据中难以可靠估计;因此,策略可能会过早地降低可能包含高价值行为的未充分探索区域的权重。在本文中,我们提出了用于偏好优化的数据依赖探索(DEPO),这是一种简单且可扩展的方法,利用历史数据为高不确定性区域构建额外的不确定性奖励,鼓励向潜在高价值数据进行探索。在理论上,我们为所提出的算法提供了数据依赖的遗憾界限,表明它能适应学习任务本身的难度,且在实践中可比最坏情况界限更紧。在实验上,所提出的方法在各基准上始终优于强基线,展现出更高的样本效率。

关键词

引用

@article{arxiv.2605.04477,
  title  = {Data-dependent Exploration for Online Reinforcement Learning from Human Feedback},
  author = {Zhen-Yu Zhang and Yuting Tang and Jiandong Zhang and Lanjihong Ma and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:2605.04477},
  year   = {2026}
}