一种用于鲁棒强化学习的贝叶斯方法
机器学习
2019-07-25 v2 人工智能
机器学习
摘要
鲁棒马尔可夫决策过程(RMDPs)旨在确保对变化的或对抗性的系统行为具有鲁棒性。在该框架下,状态转移被建模为已知且结构良好的不确定性集合中的任意元素,并且可以在最坏情况下推导出鲁棒最优策略。在本研究中,我们采用贝叶斯方法解决 RMDPs 中的学习问题。我们引入了不确定性鲁棒贝尔曼方程(URBE),它鼓励安全探索,从而将不确定性集合适应于新的观测,同时保持鲁棒性。我们提出了一种基于 URBE 的算法 DQN-URBE,将该方法扩展到更高维的领域。我们的实验表明,所推导的基于 URBE 的策略在模型误设情况下,能够在较不保守的解与鲁棒性之间实现更好的权衡。此外,我们表明,与具有固定不确定性集合的现有鲁棒技术相比,DQN-URBE 算法能够显著更快地在线适应变化的动态。
引用
@article{arxiv.1905.08188,
title = {A Bayesian Approach to Robust Reinforcement Learning},
author = {Esther Derman and Daniel Mankowitz and Timothy Mann and Shie Mannor},
journal= {arXiv preprint arXiv:1905.08188},
year = {2019}
}
备注
Accepted to UAI 2019