具有未知链接函数的可证明人类反馈强化学习
机器学习
2025-06-04 v1 机器学习
摘要
链接函数刻画了在强化学习问题中人类偏好如何由价值函数生成,是设计 RLHF 算法的关键组件。几乎所有 RLHF 算法,包括实证研究中处于领先水平的 DPO 和 PPO,都假设智能体已知链接函数(例如根据 Bradley-Terry 模型的逻辑斯蒂函数),考虑到人类偏好的复杂性,这一假设可以说是不切实际的。为避免链接函数误设,本文研究具有未知链接函数的一般 RLHF 问题。我们提出了一种基于新型零阶策略优化方法的新颖策略优化算法 ZSPO,其关键在于利用人类偏好构建一个与真实策略梯度方向正相关的参数更新方向。ZSPO 通过估计价值函数差的符号而非从价值函数差中估计梯度来实现这一点,因此它不需要已知链接函数。在温和条件下,ZSPO 收敛至平稳策略,且收敛速率是关于策略迭代次数与每次迭代轨迹数的多项式速率。数值结果同样表明,ZSPO 在链接函数失配时具有优越性。
引用
@article{arxiv.2506.03066,
title = {Provable Reinforcement Learning from Human Feedback with an Unknown Link Function},
author = {Qining Zhang and Lei Ying},
journal= {arXiv preprint arXiv:2506.03066},
year = {2025}
}