马尔可夫决策过程中尖峰式奖励腐败的检测
机器学习
2019-07-02 v1 机器学习
摘要
当前的强化学习方法在奖励函数不完美时会失效,即智能体观测到的奖励与其实际获得的奖励不同。我们在腐败奖励马尔可夫决策过程(CRMDP)的形式体系内研究此问题。我们表明,若 CRMDP 中的奖励腐败足够“尖峰式”,则该环境可解。我们完整刻画了尖峰式 CRMDP 的悔界,并引入一种能够检测其腐败状态的算法。我们表明该算法可用于通过任意常见强化学习算法学习最优策略。最后,我们在一对简单网格世界环境中考察了我们的算法,发现尽管存在腐败,该算法仍能检测腐败状态并学习最优策略。
引用
@article{arxiv.1907.00452,
title = {Detecting Spiky Corruption in Markov Decision Processes},
author = {Jason Mancuso and Tomasz Kisielewski and David Lindner and Alok Singh},
journal= {arXiv preprint arXiv:1907.00452},
year = {2019}
}
备注
paper accepted to the AI Safety Workshop at IJCAI-19