中文

有限 MDP 中的情景式强化学习:极小极大下界再探

机器学习 2020-10-09 v1 机器学习

摘要

在本文中,我们提出情景式 MDP 中样本复杂度和后悔值的新的与问题无关的下界,特别关注非平稳情形,即转移核允许在情景的每个阶段改变。我们的主要贡献是针对非平稳 MDP 中最佳策略辨识的 (ε,δ)(\varepsilon,\delta)-PAC 算法,给出了 Ω((H3SA/ϵ2)log(1/δ))\Omega((H^3SA/\epsilon^2)\log(1/\delta)) 的样本复杂度新下界。该下界依赖于一种与文献中先前所用不同的“困难 MDP”构造。利用同一类 MDP,我们也给出了非平稳 MDP 的 Ω(H3SAT)\Omega(\sqrt{H^3SAT}) 后悔界 rigorous 证明。最后,我们讨论了与 PAC-MDP 下界的联系。

关键词

引用

@article{arxiv.2010.03531,
  title  = {Episodic Reinforcement Learning in Finite MDPs: Minimax Lower Bounds Revisited},
  author = {Omar Darwiche Domingues and Pierre Ménard and Emilie Kaufmann and Michal Valko},
  journal= {arXiv preprint arXiv:2010.03531},
  year   = {2020}
}