中文

表格强化学习中渐近高效的离屏策略评估

机器学习 2020-07-09 v1 人工智能 机器学习

摘要

我们考虑强化学习中的离屏策略评估问题,其目标是在使用记录策略 μ\mu 运行的离线数据来估计目标策略 π\pi 的期望回报。该问题的标准基于重要性采样的方法存在随时间段 HH 呈指数级增长的方差,这促使近期大量关注能够打破“时间段诅咒”(Liu et al. 2018, Xie et al. 2019)的替代方法。特别地,已有研究表明,在具有有限状态且可能无限动作的情景式马尔可夫决策过程模型下,边缘化重要性采样(MIS)方法可用于实现均方误差(MSE)中阶为 O(H3/n)O(H^3/ n) 的估计误差。然而该 MSE 界仍与阶为 Ω(H2/n)\Omega(H^2/n) 的 Cramer-Rao 下界相差一个 HH 的因子。在本文中,我们证明通过对 MIS 估计量进行简单修正,只要动作空间有限,我们就能渐近地达到 Cramer-Rao 下界。我们还提供了一种构造具有高概率误差界的 MIS 估计量的一般方法。

关键词

引用

@article{arxiv.2001.10742,
  title  = {Asymptotically Efficient Off-Policy Evaluation for Tabular Reinforcement Learning},
  author = {Ming Yin and Yu-Xiang Wang},
  journal= {arXiv preprint arXiv:2001.10742},
  year   = {2020}
}

备注

Includes appendix. Accepted for AISTATS 2020