中文

强化学习从人类反馈中的贪心抽样在理论上是高效的

机器学习 2025-10-29 v1 人工智能 信息论 math.IT 机器学习

摘要

强化学习从人类反馈(RLHF)已成为后训练大语言模型的关键技术。尽管其实证成功显著,但其理论理解仍有限,因为仅凭偏好反馈学习 KL 正则化目标相较于经典 RL 面临额外挑战。现有工作大多研究基于奖励的 Bradley-Terry(BT)偏好模型,并扩展利用乐观或悲观性的经典设计。本工作则考虑一般偏好模型(其实际相关性近期被观察到),并获得性能保证,显著优于现有方法。令人惊讶的是,这些结果源自使用经验估计(即贪心抽样)直接使用,而非如前述工作中构造乐观或悲观估计。这一洞见深植于在 KL 正则化目标下最优策略类的独特结构属性中,我们进一步针对 BT 模型加以特化,凸显贪心抽样在 RLHF 中的惊人充分性。

关键词

引用

@article{arxiv.2510.24700,
  title  = {Greedy Sampling Is Provably Efficient for RLHF},
  author = {Di Wu and Chengshuai Shi and Jing Yang and Cong Shen},
  journal= {arXiv preprint arXiv:2510.24700},
  year   = {2025}
}

备注

NeurIPS 2025