具有非马尔可夫奖励的强化学习
人工智能
2019-12-06 v1
摘要
标准强化学习世界模型是马尔可夫决策过程(MDP)。MDP 的一个基本前提是奖励仅依赖于最后的状态和动作。然而,许多现实世界的奖励是非马尔可夫的。例如,仅当先前被请求且尚未送达时才因送咖啡而给予奖励,若状态仅记录当前请求与送达,则该奖励是非马尔可夫的。以往工作考虑了建模与求解具有非马尔可夫奖励(NMR)的 MDP 的问题,但我们知道尚无针对 NMR 下强化学习的系统性方法。此处,我们处理从此类奖励的经验中学习策略的问题。我们描述并实证评估了经典强化学习算法 Q-learning 与 R-max 同自动机学习算法的四种组合,从而得到用于具有 NMR 的领域的新的强化学习算法。我们还证明了其中某些变体在极限下收敛到最优策略。
引用
@article{arxiv.1912.02552,
title = {Reinforcement Learning with Non-Markovian Rewards},
author = {Maor Gaon and Ronen I. Brafman},
journal= {arXiv preprint arXiv:1912.02552},
year = {2019}
}
备注
To Appear in AAAI 2020