中文

VIPeR:一种带神经函数逼近的离线强化学习可证明高效算法

机器学习 2023-03-07 v2

摘要

我们提出了一种名为带扰动奖励的值迭代(VIPeR)的离线强化学习新算法,该算法将悲观原则与值函数的随机扰动相结合。当前大多数离线RL算法显式构造统计置信区域,通过下置信界(LCB)获得悲观性,这难以扩展到使用神经网络估计值函数的复杂问题。相反,VIPeR通过用精心设计的独立同分布高斯噪声对离线数据进行多次扰动,学习一组估计的状态-动作值函数集成,并针对该集成的最小值采取贪婪策略,从而隐式地获得悲观性。估计的状态-动作值是通过使用梯度下降将参数化模型(例如神经网络)拟合到扰动数据集上得到的。因此,VIPeR的动作选择时间复杂度仅为O(1)\mathcal{O}(1),而基于LCB的算法至少需要Ω(K2)\Omega(K^2),其中KK是离线数据中轨迹的总数。我们还提出了一种新颖的数据分割技术,有助于从我们的界中去除一个涉及覆盖数对数的因子。我们证明,VIPeR在过参数化神经网络下产生可证明的不确定性量化器,并享有次优性界O~(κH5/2d~/K)\tilde{\mathcal{O}}( { \kappa H^{5/2} \tilde{d} }/{\sqrt{K}}),其中d~\tilde{d}是有效维度,HH是 horizon 长度,κ\kappa度量分布偏移。我们通过在广泛合成与真实世界数据集上的实证评估证实了VIPeR的统计与计算效率。据我们所知,VIPeR是首个对带神经网络函数逼近的一般马尔可夫决策过程(MDPs)具有可证明高效性的离线RL算法。

关键词

引用

@article{arxiv.2302.12780,
  title  = {VIPeR: Provably Efficient Algorithm for Offline RL with Neural Function Approximation},
  author = {Thanh Nguyen-Tang and Raman Arora},
  journal= {arXiv preprint arXiv:2302.12780},
  year   = {2023}
}

备注

top-25%-noble ICLR'23; code: https://github.com/thanhnguyentang/neural-offline-rl; v2: change title