中文

具有聚合状态的可证明高效强化学习

机器学习 2020-02-20 v2 机器学习 最优化与控制

摘要

我们证明,将乐观变体的 Q-learning 应用于具有聚合状态表示的固定时域 episodic 马尔可夫决策过程时,其遗憾界为 O~(H5MK+ϵHK)\tilde{\mathcal{O}}(\sqrt{H^5 M K} + \epsilon HK),其中 HH 为时域,MM 为聚合状态数,KK 为 episode 数,ϵ\epsilon 为与同一聚合状态相关联的任意一对最优状态-动作值之间的最大差异。值得注意的是,该遗憾界不依赖于状态数或动作数,并且表明渐近每周期遗憾不大于 ϵ\epsilon,且与时域无关。据我们所知,这是首个适用于具有非平凡值函数近似且对转移概率无任何限制的强化学习的结果。

关键词

引用

@article{arxiv.1912.06366,
  title  = {Provably Efficient Reinforcement Learning with Aggregated States},
  author = {Shi Dong and Benjamin Van Roy and Zhengyuan Zhou},
  journal= {arXiv preprint arXiv:1912.06366},
  year   = {2020}
}