中文

关于离线 RLHF 两两比较下的指数收敛性

机器学习 2026-01-23 v2 人工智能 信息论 math.IT 统计理论 机器学习 统计理论

摘要

我们考虑离线强化学习从人类反馈(RLHF)中进行两两比较的问题,由 Zhu 等人于 2023 年提出,其中隐式奖励是未知参数的线性函数。给定离线数据集,我们的目标是确定每个状态的最优动作,以实现最小简单后悔(simple regret)。我们提出一种算法,即带有本地最优权重的强化学习(RL-LOW),其简单后悔呈指数形式为 exp(Ω(n/H))\exp ( - \Omega(n/H) ),其中 nn 为数据样本数,HH 表示与每个动作次优间隙显式相关的实例相关难度量。此外,我们推导了离线 RLHF 两两比较中首个实例相关下界。有趣的是,我们观察到简单后悔的下界和上界在指数中呈一次序匹配,这表明我们的 RL-LOW 在指数级上是最优的。在视野实际应用中的隐私考虑方面,我们还将 RL-LOW 扩展至 (ε,δ)(\varepsilon,\delta)-差分隐私设置,证明当 nn 趋于无穷大时,硬度参数 HH 在渐近情形下保持不变;这凸显了 RL-LOW 在保持观察奖励隐私方面的固有效率。鉴于我们聚焦于建立指数收敛的实例相关界限,我们的方法填补了现有研究在建立离线 RLHF 两两比较中逆多项式收敛(例如 O~(1n)\widetilde{O}(\frac{1}{\sqrt{n}}))的 worst-case 后悔的空白。

关键词

引用

@article{arxiv.2406.12205,
  title  = {On the Exponential Convergence for Offline RLHF with Pairwise Comparisons},
  author = {Zhirui Chen and Vincent Y. F. Tan},
  journal= {arXiv preprint arXiv:2406.12205},
  year   = {2026}
}

备注

Accepted as an oral presentation at AAAI 2026 (AI Alignment Track)