强化学习从人类反馈中的贪心抽样在理论上是高效的
机器学习
2025-10-29 v1 人工智能
信息论
math.IT
机器学习
摘要
强化学习从人类反馈(RLHF)已成为后训练大语言模型的关键技术。尽管其实证成功显著,但其理论理解仍有限,因为仅凭偏好反馈学习 KL 正则化目标相较于经典 RL 面临额外挑战。现有工作大多研究基于奖励的 Bradley-Terry(BT)偏好模型,并扩展利用乐观或悲观性的经典设计。本工作则考虑一般偏好模型(其实际相关性近期被观察到),并获得性能保证,显著优于现有方法。令人惊讶的是,这些结果源自使用经验估计(即贪心抽样)直接使用,而非如前述工作中构造乐观或悲观估计。这一洞见深植于在 KL 正则化目标下最优策略类的独特结构属性中,我们进一步针对 BT 模型加以特化,凸显贪心抽样在 RLHF 中的惊人充分性。
引用
@article{arxiv.2510.24700,
title = {Greedy Sampling Is Provably Efficient for RLHF},
author = {Di Wu and Chengshuai Shi and Jing Yang and Cong Shen},
journal= {arXiv preprint arXiv:2510.24700},
year = {2025}
}
备注
NeurIPS 2025