中文

基于深度网络在低维流形上进行非参数离屏策略评估的样本复杂度

机器学习 2022-10-05 v2 机器学习

摘要

我们考虑使用深度卷积神经网络的强化学习离屏策略评估问题。当数据由未知行为策略生成时,我们分析了用于估计目标策略期望累积奖励的深度拟合Q评估方法。我们表明,通过适当选择网络规模,可以利用马尔可夫决策过程中的任何低维流形结构,获得样本高效的估计器,而不受高数据 ambient 维数诅咒的影响。具体而言,我们建立了拟合Q评估的尖锐误差界,其依赖于状态-动作空间的内在维数、Bellman算子的光滑性,以及函数类受限的 χ2\chi^2-散度。值得注意的是,受限 χ2\chi^2-散度度量的是行为策略与目标策略在{\it 函数空间}中的不匹配,即使两个策略在其表格形式下彼此不接近,该散度也可能很小。我们还发展了卷积神经网络在Q函数估计中的一种新颖逼近结果。我们提供了数值实验以支持我们的理论分析。

关键词

引用

@article{arxiv.2206.02887,
  title  = {Sample Complexity of Nonparametric Off-Policy Evaluation on Low-Dimensional Manifolds using Deep Networks},
  author = {Xiang Ji and Minshuo Chen and Mengdi Wang and Tuo Zhao},
  journal= {arXiv preprint arXiv:2206.02887},
  year   = {2022}
}

备注

52 pages, 2 figures