中文

潜马尔可夫决策过程的强化学习:后悔保证与下界

机器学习 2021-02-10 v1

摘要

在本工作中,我们考虑潜马尔可夫决策过程(LMDP)中强化学习的后悔最小化问题。在 LMDP 中,交互开始时从 MM 个可能 MDP 的集合中随机抽取一个 MDP,但所选 MDP 的标识不向智能体揭示。我们首先证明,一般情形的 LMDP 需要至少 Ω((SA)M)\Omega((SA)^M) 轮交互才能近似最优策略。随后,我们考虑充分假设,在此假设下学习良好策略只需多项式轮数。我们表明关键联系在于 MDP 系统动态之间的一种分离概念。在充分分离下,我们提供一种具局部保证的高效算法,即给定良好初始化时提供次线性后悔保证。最后,若给定 Predictive State Representation(PSR)文献中常见的标准统计充分性假设(如 Boots 等)与可达性假设,我们表明可去除对初始化的需求。

关键词

引用

@article{arxiv.2102.04939,
  title  = {RL for Latent MDPs: Regret Guarantees and a Lower Bound},
  author = {Jeongyeol Kwon and Yonathan Efroni and Constantine Caramanis and Shie Mannor},
  journal= {arXiv preprint arXiv:2102.04939},
  year   = {2021}
}