中文

通过参考-优势分解的近最优无模型强化学习

机器学习 2020-06-09 v2 数据结构与算法 机器学习

摘要

我们研究有限时域片段式马尔可夫决策过程(MDPs)设定下的强化学习问题,其具有SS个状态、AA个动作以及片段长度HH。我们提出一种无模型算法UCB-Advantage,并证明其实现了O~(H2SAT)\tilde{O}(\sqrt{H^2SAT})的遗憾值,其中T=KHT = KHKK为要执行的片段数。我们的遗憾界改进了[Jin et al., 2018]的结果,并匹配已知最好的基于模型的算法以及信息论下界(直至对数因子)。我们还展示了UCB-Advantage实现了较低的局部切换代价,并可应用于并发强化学习,改进了[Bai et al., 2019]近期的结果。

关键词

引用

@article{arxiv.2004.10019,
  title  = {Almost Optimal Model-Free Reinforcement Learning via Reference-Advantage Decomposition},
  author = {Zihan Zhang and Yuan Zhou and Xiangyang Ji},
  journal= {arXiv preprint arXiv:2004.10019},
  year   = {2020}
}

备注

26 pages