中文

基于偏好的深度网络非参数离屏策略评估的样本复杂度

机器学习 2024-02-28 v2 机器学习

摘要

近来一种流行的解决强化学习的方法是利用人类偏好数据。事实上,人类偏好数据现已与经典的强化学习算法(如actor-critic方法)结合使用,这类方法涉及在因分布偏移而由人类偏好数据学习到的奖励上评估中间策略,即离屏策略评估(OPE)。此类算法包括:(i)从人类偏好数据集学习奖励函数,以及(ii)学习目标策略的期望累积奖励。尽管取得了巨大的经验成功,现有利用偏好数据的OPE方法往往缺乏理论理解且严重依赖启发式方法。本文中,我们研究了带人类偏好的OPE的样本效率并为其建立了统计保证。具体而言,我们通过用深度神经网络进行拟合-Q-评估(fitted-Q-evaluation)来学习值函数以实现OPE。通过适当选择ReLU网络的大小,我们表明可以利用马尔可夫决策过程中的任何低维流形结构,并获得样本高效的估计器,而不受高数据 ambient 维数灾难的影响。在高奖励平滑性假设下,我们的结果几乎与带有可观测奖励数据的经典OPE结果一致。据我们所知,这是首个为带RLHF的离屏策略评估建立可证明高效保证的结果。

关键词

引用

@article{arxiv.2310.10556,
  title  = {Sample Complexity of Preference-Based Nonparametric Off-Policy Evaluation with Deep Networks},
  author = {Zihao Li and Xiang Ji and Minshuo Chen and Mengdi Wang},
  journal= {arXiv preprint arXiv:2310.10556},
  year   = {2024}
}