中文

潜变量马尔可夫决策过程的无视野且与方差相关的强化学习

机器学习 2023-05-23 v3

摘要

我们研究了具有后见上下文的潜变量马尔可夫决策过程(LMDPs)中的后悔最小化问题。我们设计了一种新颖的基于模型的算法框架,可用模型乐观求解器和价值乐观求解器分别实例化。我们证明了 O~(VarMΓSAK)\tilde{O}(\sqrt{\mathsf{Var}^\star M \Gamma S A K}) 的后悔界,其中 O~\tilde{O} 隐藏了对数因子,MM 为上下文数量,SS 为状态数,AA 为动作数,KK 为回合次数,ΓS\Gamma \le S 为任意状态-动作对的最大转移度,Var\mathsf{Var}^\star 为描述 LMDP 确定性的方差量。该后悔界仅随规划视野呈对数缩放,从而给出了 LMDP 首个(近似)无视野后悔界。这也是 LMDP 首个问题依赖的后悔界。我们证明的关键在于对 alpha 向量(价值函数的推广)总方差的分析,其通过截断方法处理。我们以 Γ=2\Gamma = 2 时新颖的 Ω(VarMSAK)\Omega(\sqrt{\mathsf{Var}^\star M S A K}) 后悔下界补充了正面结果,表明当 Γ\Gamma 为常数时,我们的上界对于方差有界 LMDP 类是极小极大最优的。我们的下界依赖于困难实例的新构造以及受理论计算机科学对称化技术启发的论证,两者在技术上均不同于现有的 MDP 下界证明,因此具有独立意义。

关键词

引用

@article{arxiv.2210.11604,
  title  = {Horizon-Free and Variance-Dependent Reinforcement Learning for Latent Markov Decision Processes},
  author = {Runlong Zhou and Ruosong Wang and Simon S. Du},
  journal= {arXiv preprint arXiv:2210.11604},
  year   = {2023}
}

备注

ICML 2023