中文

一种用于无限 horizon 平均奖赏 MDP 的近最优后悔界无模型学习算法

机器学习 2020-12-10 v2 机器学习

摘要

近年来,无模型强化学习因其简单性、内存与计算效率,以及结合函数近似的灵活性而受到研究关注。在本文中,我们提出探索增强 Q 学习(EE-QL),一种用于无限 horizon 平均奖赏马尔可夫决策过程(MDP)的无模型算法,在广义弱通信 MDP 类上实现了 O(T)O(\sqrt{T}) 的后悔界,其中 TT 为交互次数。EE-QL 假设可获得最优平均奖赏的在线集中近似。这是首个在无遍历假设下实现 O(T)O(\sqrt T) 后悔且无模型的学习算法,并且在 TT 项上除对数因子外匹配下界。实验表明,所提算法性能与已知最佳基于模型的算法相当。

关键词

引用

@article{arxiv.2006.04354,
  title  = {A Model-free Learning Algorithm for Infinite-horizon Average-reward MDPs with Near-optimal Regret},
  author = {Mehdi Jafarnia-Jahromi and Chen-Yu Wei and Rahul Jain and Haipeng Luo},
  journal= {arXiv preprint arXiv:2006.04354},
  year   = {2020}
}

备注

There is a bug in the proof of Lemma 2 that is not easily fixable