中文

基于紧致贝叶斯似真集的鲁棒探索

机器学习 2019-04-19 v1 人工智能 机器学习

摘要

对了解甚少的状态和动作的乐观态度是许多可证明高效的强化学习算法探索的主要驱动力。我们提出面对合理值函数的乐观(OFVF)——一种新颖的数据驱动贝叶斯算法,用于为MDPs构造似真集以鲁棒地探索并最小化最坏情况探索代价。该方法通过引入两个新思路来计算具有更紧致乐观估计的探索策略。首先,它基于贝叶斯后验分布而非无分布界。其次,OFVF不将似真集构造为简单的置信区间。作为似真集的置信区间是充分但非必要条件。OFVF利用值函数的结构来优化似真集的位置和形状,以直接保证上界,而不必强制要求该集为置信区间。OFVF以情节式方式进行,其中情节的时长是固定且已知的。我们的算法本质上是贝叶斯的,并且可以利用先验信息。我们的理论分析显示了OFVF的鲁棒性,实证结果展示了其实际前景。

关键词

引用

@article{arxiv.1904.08528,
  title  = {Robust Exploration with Tight Bayesian Plausibility Sets},
  author = {Reazul H. Russel and Tianyi Gu and Marek Petrik},
  journal= {arXiv preprint arXiv:1904.08528},
  year   = {2019}
}