中文

具有非马尔可夫奖励的强化学习

人工智能 2019-12-06 v1

摘要

标准强化学习世界模型是马尔可夫决策过程(MDP)。MDP 的一个基本前提是奖励仅依赖于最后的状态和动作。然而,许多现实世界的奖励是非马尔可夫的。例如,仅当先前被请求且尚未送达时才因送咖啡而给予奖励,若状态仅记录当前请求与送达,则该奖励是非马尔可夫的。以往工作考虑了建模与求解具有非马尔可夫奖励(NMR)的 MDP 的问题,但我们知道尚无针对 NMR 下强化学习的系统性方法。此处,我们处理从此类奖励的经验中学习策略的问题。我们描述并实证评估了经典强化学习算法 Q-learning 与 R-max 同自动机学习算法的四种组合,从而得到用于具有 NMR 的领域的新的强化学习算法。我们还证明了其中某些变体在极限下收敛到最优策略。

关键词

引用

@article{arxiv.1912.02552,
  title  = {Reinforcement Learning with Non-Markovian Rewards},
  author = {Maor Gaon and Ronen I. Brafman},
  journal= {arXiv preprint arXiv:1912.02552},
  year   = {2019}
}

备注

To Appear in AAAI 2020