中文

强化学习离线策略评估中近最优可证明的一致收敛性

机器学习 2020-12-02 v2 人工智能 机器学习

摘要

强化学习(RL)中的离线策略评估(OPE)问题是将 RL 应用于实际生活场景的关键一步。现有关于 OPE 的工作大多集中于评估一个固定的目标策略 π\pi,这无法为离线策略学习提供有用的界,因为此时的 π\pi 将依赖于数据。我们通过同时评估策略类 Π\Pi 中的所有策略——即 OPE 中的一致收敛——来解决该问题,并对若干全局/局部策略类获得了近乎最优的误差界。我们的结果表明,在时变非齐次片段式 MDP 模型下(HH 为规划时域,dmd_m 为反映日志策略 μ\mu 探索程度的一个量),基于模型的规划在识别 ϵ\epsilon-最优策略时达到了 O~(H3/dmϵ2)\widetilde{O}(H^3/d_m\epsilon^2) 的最优片段复杂度。据我们所知,这是首次表明离线 RL 设定下最优速率是可能实现的,且本文是首篇系统研究 OPE 中一致收敛的论文。

关键词

引用

@article{arxiv.2007.03760,
  title  = {Near-Optimal Provable Uniform Convergence in Offline Policy Evaluation for Reinforcement Learning},
  author = {Ming Yin and Yu Bai and Yu-Xiang Wang},
  journal= {arXiv preprint arXiv:2007.03760},
  year   = {2020}
}

备注

Short version presented at Offline RL workshop at Neurips, 2020