有限时域 MDP 的完全问题相关后悔下界
机器学习
2021-06-25 v1
摘要
我们推导了有限时域表格型马尔可夫决策过程(MDP)中后悔最小化的新颖渐近问题相关下界。虽然与先前工作(如针对遍历 MDP)类似,该下界是一个优化问题的解,但我们的推导揭示出需要对状态-动作对上的访问分布施加一个额外约束,以显式计入 MDP 的动力学。我们通过一系列示例刻画了该下界,说明不同 MDP 的复杂度可能显著不同。1)我们首先考虑一个“困难”MDP 实例,其中基于动力学的新约束导致比经典分析更大的下界(即更大的后悔)。2)我们随后表明,我们的下界恢复了先前针对特定 MDP 实例推导的结果。3)最后我们表明,在某些“简单”MDP 中,下界远小于一般情形,且完全不随最小动作间隙而增长。我们给出了一个基于策略间隙的乐观算法的后悔上界,表明这最后的结果是可达到的(相差 项,其中 为时域)。
引用
@article{arxiv.2106.13013,
title = {A Fully Problem-Dependent Regret Lower Bound for Finite-Horizon MDPs},
author = {Andrea Tirinzoni and Matteo Pirotta and Alessandro Lazaric},
journal= {arXiv preprint arXiv:2106.13013},
year = {2021}
}