通过参考-优势分解的近最优无模型强化学习
机器学习
2020-06-09 v2 数据结构与算法
机器学习
摘要
我们研究有限时域片段式马尔可夫决策过程(MDPs)设定下的强化学习问题,其具有个状态、个动作以及片段长度。我们提出一种无模型算法UCB-Advantage,并证明其实现了的遗憾值,其中,为要执行的片段数。我们的遗憾界改进了[Jin et al., 2018]的结果,并匹配已知最好的基于模型的算法以及信息论下界(直至对数因子)。我们还展示了UCB-Advantage实现了较低的局部切换代价,并可应用于并发强化学习,改进了[Bai et al., 2019]近期的结果。
引用
@article{arxiv.2004.10019,
title = {Almost Optimal Model-Free Reinforcement Learning via Reference-Advantage Decomposition},
author = {Zihan Zhang and Yuan Zhou and Xiangyang Ji},
journal= {arXiv preprint arXiv:2004.10019},
year = {2020}
}
备注
26 pages