中文

基于自适应多步自助法的表格 MDP 细粒度间隙依赖界

机器学习 2021-07-05 v2

摘要

本文提出一种用于片段式有限 horizon 马尔可夫决策过程(MDP)的无模型新算法——自适应多步自助法(AMB),其具有更强的间隙依赖后悔界。第一项创新是将乐观自助法与自适应多步蒙特卡洛展开相结合来估计最优 QQ 函数。第二项创新是在不被任何其他动作支配的可行动作中,选择置信区间长度最大的动作。我们证明当每个状态有唯一最优动作时,AMB 实现的间隙依赖后悔界仅随次优间隙倒数之和缩放。相比之下,Simchowitz 与 Jamieson(2019)指出所有上置信界(UCB)算法因过度探索会承受额外的 Ω(SΔmin)\Omega\left(\frac{S}{\Delta_{min}}\right) 后悔,其中 Δmin\Delta_{min} 为最小次优间隙,SS 为状态数。我们进一步证明对于一般 MDP,AMB 承受额外的 ZmulΔmin\frac{|Z_{mul}|}{\Delta_{min}} 后悔,其中 ZmulZ_{mul} 为满足 aass 的非唯一最优动作的状态-动作对 (s,a)(s,a) 集合。我们以一个下界补充上界,表明任何一致算法对 ZmulΔmin\frac{|Z_{mul}|}{\Delta_{min}} 的依赖性均不可避免。该下界也暗示了强化学习与情境_bandit 之间的分离。

关键词

引用

@article{arxiv.2102.04692,
  title  = {Fine-Grained Gap-Dependent Bounds for Tabular MDPs via Adaptive Multi-Step Bootstrap},
  author = {Haike Xu and Tengyu Ma and Simon S. Du},
  journal= {arXiv preprint arXiv:2102.04692},
  year   = {2021}
}

备注

Accepted for presentation at the Conference on Learning Theory (COLT) 2021