中文

基于马尔可夫链集中的强化学习后悔界

机器学习 2019-01-23 v2 机器学习

摘要

我们给出一个简单的乐观算法,对于具有 SS 个状态、AA 个动作和混合时间参数 tmixt_{\rm mix} 的一致遍历马尔可夫决策过程,容易推导其在 TT 步后的后悔界为 O~(tmixSAT)\tilde{O}(\sqrt{t_{\rm mix} SAT})。这些界是一般非片段式设定中首批在所有给定参数上均具有最优依赖关系的后悔界。它们仅能通过采用另一种混合时间参数来改进。

关键词

引用

@article{arxiv.1808.01813,
  title  = {Regret Bounds for Reinforcement Learning via Markov Chain Concentration},
  author = {Ronald Ortner},
  journal= {arXiv preprint arXiv:1808.01813},
  year   = {2019}
}