基于深度 ReLU 网络的离线强化学习的样本复杂度
机器学习
2022-12-15 v6 机器学习
摘要
离线强化学习(RL)利用先前收集的数据进行策略优化,而无需任何进一步的主动探索。尽管近期对该问题兴趣浓厚,其在神经网络函数逼近设定下的理论结果仍不明朗。本文研究基于深度 ReLU 网络函数逼近的离线 RL 的统计理论。具体而言,我们建立了离线 RL 与深度 ReLU 网络的样本复杂度 ,其中 是分布偏移的度量,{ 为有效视界长度}, 是状态-动作空间的维数, 是底层马尔可夫决策过程(MDP)的(可能为分数的)平滑参数, 是用户指定的误差。值得注意的是,我们的样本复杂度在两种新颖考量下成立:Besov 动态闭包与相关结构。Besov 动态闭包包含了先前工作中离线 RL 的动态条件,而相关结构使得先前关于一般/神经网络函数逼近的离线 RL 工作在长(有效)视界问题中不适用或低效。据我们所知,这是在超越传统再生核希尔伯特空间与神经正切核中线性机制的通用 Besov 正则性条件下,对深度神经网络函数逼近的离线 RL 样本复杂度的首个理论刻画。
引用
@article{arxiv.2103.06671,
title = {Sample Complexity of Offline Reinforcement Learning with Deep ReLU Networks},
author = {Thanh Nguyen-Tang and Sunil Gupta and Hung Tran-The and Svetha Venkatesh},
journal= {arXiv preprint arXiv:2103.06671},
year = {2022}
}
备注
https://openreview.net/forum?id=LdEm0umNcv