中文

时间齐次、无奖励与任务无关设定下的最优一致离线策略评估及基于模型的离线强化学习

机器学习 2021-06-25 v3 人工智能 机器学习

摘要

本文研究了基于模型的方法(针对情节式 MDP)在离线策略评估(OPE)问题一致收敛的统计极限,并为若干具有充分动机的离线任务提供了通向最优学习的统一框架。一致 OPE supΠQπQ^π<ϵ\sup_\Pi|Q^\pi-\hat{Q}^\pi|<\epsilon 是比逐点 OPE 更强的度量,并且当 Π\Pi 包含所有策略(全局类)时可保证离线学习。本文建立了全局一致 OPE 的 Ω(H2S/dmϵ2)\Omega(H^2 S/d_m\epsilon^2) 下界(在基于模型的族上),而我们的主要结果针对具有\emph{平稳}转移的 MDP,建立了适用于所有\emph{近经验最优}策略的\emph{局部}一致收敛的 O~(H2/dmϵ2)\tilde{O}(H^2/d_m\epsilon^2) 上界。此处 dmd_m 为最小边缘状态-动作概率。关键的是,达到最优速率 O~(H2/dmϵ2)\tilde{O}(H^2/d_m\epsilon^2) 的亮点在于我们设计的\emph{单态吸收 MDP},这是一种与基于模型方法配合使用的新的锐利分析工具。我们将此种基于模型的框架推广到新设定:离线任务无关与离线无奖励,其最优复杂度分别为 O~(H2log(K)/dmϵ2)\tilde{O}(H^2\log(K)/d_m\epsilon^2)KK 为任务数)与 O~(H2S/dmϵ2)\tilde{O}(H^2S/d_m\epsilon^2)。这些结果为同时求解不同离线 RL 问题提供了统一方案。

关键词

引用

@article{arxiv.2105.06029,
  title  = {Optimal Uniform OPE and Model-based Offline Reinforcement Learning in Time-Homogeneous, Reward-Free and Task-Agnostic Settings},
  author = {Ming Yin and Yu-Xiang Wang},
  journal= {arXiv preprint arXiv:2105.06029},
  year   = {2021}
}