中文

一种用于鲁棒强化学习的贝叶斯方法

机器学习 2019-07-25 v2 人工智能 机器学习

摘要

鲁棒马尔可夫决策过程(RMDPs)旨在确保对变化的或对抗性的系统行为具有鲁棒性。在该框架下,状态转移被建模为已知且结构良好的不确定性集合中的任意元素,并且可以在最坏情况下推导出鲁棒最优策略。在本研究中,我们采用贝叶斯方法解决 RMDPs 中的学习问题。我们引入了不确定性鲁棒贝尔曼方程(URBE),它鼓励安全探索,从而将不确定性集合适应于新的观测,同时保持鲁棒性。我们提出了一种基于 URBE 的算法 DQN-URBE,将该方法扩展到更高维的领域。我们的实验表明,所推导的基于 URBE 的策略在模型误设情况下,能够在较不保守的解与鲁棒性之间实现更好的权衡。此外,我们表明,与具有固定不确定性集合的现有鲁棒技术相比,DQN-URBE 算法能够显著更快地在线适应变化的动态。

关键词

引用

@article{arxiv.1905.08188,
  title  = {A Bayesian Approach to Robust Reinforcement Learning},
  author = {Esther Derman and Daniel Mankowitz and Timothy Mann and Shie Mannor},
  journal= {arXiv preprint arXiv:1905.08188},
  year   = {2019}
}

备注

Accepted to UAI 2019