中文

通过基于偏好的探索避免 RLHF 中的 $\mathbf{exp(R_{max})}$ 缩放

机器学习 2025-09-29 v3 人工智能 机器学习

摘要

基于人类反馈的强化学习 (RLHF) 已成为大语言模型 (LLM) 对齐的关键技术。本文研究了在线 RLHF 的设置,并专注于提高样本效率。所有现有的在线 RLHF 算法,无论是进行被动探索还是主动探索,其样本复杂度都随奖励函数的规模呈指数级缩放。这一根本性限制阻碍了它们在偏好严重偏斜的场景(例如具有唯一正确解的问题)中的有效性。为了解决这个问题,我们引入了自探索偏好激励在线偏好优化 (SE-POPO),这是一种在线 RLHF 算法,首次实现了样本复杂度随奖励规模多项式级缩放,回答了 Xie 等人 (2024) 提出的一个开放问题。理论上,我们证明了 SE-POPO 的样本复杂度优于现有的探索算法。在实证上,我们的系统评估证实,在 RLHF 的两个主要应用场景以及公共基准测试中,SE-POPO 比探索性和非探索性基线方法都具有更高的样本效率,这标志着 RLHF 算法设计向前迈出了重要一步。代码可在 https://github.com/MYC000801/SE-POPO 获取。

关键词

引用

@article{arxiv.2502.00666,
  title  = {Avoiding $\mathbf{exp(R_{max})}$ scaling in RLHF through Preference-based Exploration},
  author = {Mingyu Chen and Yiding Chen and Wen Sun and Xuezhou Zhang},
  journal= {arXiv preprint arXiv:2502.00666},
  year   = {2025}
}