关于离线 RLHF 两两比较下的指数收敛性
机器学习
2026-01-23 v2 人工智能
信息论
math.IT
统计理论
机器学习
统计理论
摘要
我们考虑离线强化学习从人类反馈(RLHF)中进行两两比较的问题,由 Zhu 等人于 2023 年提出,其中隐式奖励是未知参数的线性函数。给定离线数据集,我们的目标是确定每个状态的最优动作,以实现最小简单后悔(simple regret)。我们提出一种算法,即带有本地最优权重的强化学习(RL-LOW),其简单后悔呈指数形式为 ,其中 为数据样本数, 表示与每个动作次优间隙显式相关的实例相关难度量。此外,我们推导了离线 RLHF 两两比较中首个实例相关下界。有趣的是,我们观察到简单后悔的下界和上界在指数中呈一次序匹配,这表明我们的 RL-LOW 在指数级上是最优的。在视野实际应用中的隐私考虑方面,我们还将 RL-LOW 扩展至 -差分隐私设置,证明当 趋于无穷大时,硬度参数 在渐近情形下保持不变;这凸显了 RL-LOW 在保持观察奖励隐私方面的固有效率。鉴于我们聚焦于建立指数收敛的实例相关界限,我们的方法填补了现有研究在建立离线 RLHF 两两比较中逆多项式收敛(例如 )的 worst-case 后悔的空白。
引用
@article{arxiv.2406.12205,
title = {On the Exponential Convergence for Offline RLHF with Pairwise Comparisons},
author = {Zhirui Chen and Vincent Y. F. Tan},
journal= {arXiv preprint arXiv:2406.12205},
year = {2026}
}
备注
Accepted as an oral presentation at AAAI 2026 (AI Alignment Track)