有限 MDP 中的情景式强化学习:极小极大下界再探
机器学习
2020-10-09 v1 机器学习
摘要
在本文中,我们提出情景式 MDP 中样本复杂度和后悔值的新的与问题无关的下界,特别关注非平稳情形,即转移核允许在情景的每个阶段改变。我们的主要贡献是针对非平稳 MDP 中最佳策略辨识的 -PAC 算法,给出了 的样本复杂度新下界。该下界依赖于一种与文献中先前所用不同的“困难 MDP”构造。利用同一类 MDP,我们也给出了非平稳 MDP 的 后悔界 rigorous 证明。最后,我们讨论了与 PAC-MDP 下界的联系。
引用
@article{arxiv.2010.03531,
title = {Episodic Reinforcement Learning in Finite MDPs: Minimax Lower Bounds Revisited},
author = {Omar Darwiche Domingues and Pierre Ménard and Emilie Kaufmann and Michal Valko},
journal= {arXiv preprint arXiv:2010.03531},
year = {2020}
}