VIPeR:一种带神经函数逼近的离线强化学习可证明高效算法
机器学习
2023-03-07 v2
摘要
我们提出了一种名为带扰动奖励的值迭代(VIPeR)的离线强化学习新算法,该算法将悲观原则与值函数的随机扰动相结合。当前大多数离线RL算法显式构造统计置信区域,通过下置信界(LCB)获得悲观性,这难以扩展到使用神经网络估计值函数的复杂问题。相反,VIPeR通过用精心设计的独立同分布高斯噪声对离线数据进行多次扰动,学习一组估计的状态-动作值函数集成,并针对该集成的最小值采取贪婪策略,从而隐式地获得悲观性。估计的状态-动作值是通过使用梯度下降将参数化模型(例如神经网络)拟合到扰动数据集上得到的。因此,VIPeR的动作选择时间复杂度仅为,而基于LCB的算法至少需要,其中是离线数据中轨迹的总数。我们还提出了一种新颖的数据分割技术,有助于从我们的界中去除一个涉及覆盖数对数的因子。我们证明,VIPeR在过参数化神经网络下产生可证明的不确定性量化器,并享有次优性界,其中是有效维度,是 horizon 长度,度量分布偏移。我们通过在广泛合成与真实世界数据集上的实证评估证实了VIPeR的统计与计算效率。据我们所知,VIPeR是首个对带神经网络函数逼近的一般马尔可夫决策过程(MDPs)具有可证明高效性的离线RL算法。
引用
@article{arxiv.2302.12780,
title = {VIPeR: Provably Efficient Algorithm for Offline RL with Neural Function Approximation},
author = {Thanh Nguyen-Tang and Raman Arora},
journal= {arXiv preprint arXiv:2302.12780},
year = {2023}
}
备注
top-25%-noble ICLR'23; code: https://github.com/thanhnguyentang/neural-offline-rl; v2: change title