基于深度网络在低维流形上进行非参数离屏策略评估的样本复杂度
机器学习
2022-10-05 v2 机器学习
摘要
我们考虑使用深度卷积神经网络的强化学习离屏策略评估问题。当数据由未知行为策略生成时,我们分析了用于估计目标策略期望累积奖励的深度拟合Q评估方法。我们表明,通过适当选择网络规模,可以利用马尔可夫决策过程中的任何低维流形结构,获得样本高效的估计器,而不受高数据 ambient 维数诅咒的影响。具体而言,我们建立了拟合Q评估的尖锐误差界,其依赖于状态-动作空间的内在维数、Bellman算子的光滑性,以及函数类受限的 -散度。值得注意的是,受限 -散度度量的是行为策略与目标策略在{\it 函数空间}中的不匹配,即使两个策略在其表格形式下彼此不接近,该散度也可能很小。我们还发展了卷积神经网络在Q函数估计中的一种新颖逼近结果。我们提供了数值实验以支持我们的理论分析。
引用
@article{arxiv.2206.02887,
title = {Sample Complexity of Nonparametric Off-Policy Evaluation on Low-Dimensional Manifolds using Deep Networks},
author = {Xiang Ji and Minshuo Chen and Mengdi Wang and Tuo Zhao},
journal= {arXiv preprint arXiv:2206.02887},
year = {2022}
}
备注
52 pages, 2 figures