具有一般函数逼近的在线 RLHF 中的 Thompson 采样
机器学习
2025-06-02 v1
摘要
基于人类反馈的强化学习(RLHF)在使大语言模型(LLM)与人类偏好对齐方面取得了巨大的经验成功,从理论角度研究 RLHF 算法的统计效率具有重要意义。在本工作中,我们考虑了偏好数据在学习过程中揭示的在线 RLHF 设定,并研究动作价值函数逼近。我们设计了一种受 Thompson 采样启发的、用于在线 RLHF 的无模型后验采样算法,并提供了其理论保证。具体而言,我们采用 Bellman eluder(BE)维度作为函数类的复杂度度量,并为所提算法建立了 的遗憾界,其乘性因子取决于时间跨度、BE 维度以及函数类的 -括号数。此外,在分析中,我们首先基于最大似然估计(MLE)泛化界建立了平方 Bellman 误差界的集中型不等式,这在获得 eluder 型遗憾界中发挥了关键作用,并可能具有独立的研究价值。
引用
@article{arxiv.2505.23927,
title = {Thompson Sampling in Online RLHF with General Function Approximation},
author = {Songtao Feng and Jie Fu},
journal= {arXiv preprint arXiv:2505.23927},
year = {2025}
}