中文

因子化平均奖赏 MDP 中的改进探索

机器学习 2021-03-12 v3 机器学习

摘要

我们在未知因子化马尔可夫决策过程(FMDP)下考虑平均奖赏准则中的后悔最小化任务。更具体地,我们考虑一个 FMDP,其中状态-动作空间 X\mathcal X 与状态空间 S\mathcal S 分别具有因子化形式 X=i=1nXi\mathcal X = \otimes_{i=1}^n \mathcal X_iS=i=1mSi\mathcal S=\otimes_{i=1}^m \mathcal S_i,且转移与奖赏函数关于 X\mathcal XS\mathcal S 因子化。在已知因子化结构的假设下,我们受流行的 UCRL2 策略启发引入一种新颖的后悔最小化策略,称为 DBN-UCRL,其依赖于为转移函数各元素定义的 Bernstein 型置信集。我们证明对于通用因子化结构,DBN-UCRL 达到的后悔界其首项在关于 Si\mathcal S_i 大小及所涉直径相关项的依赖上严格优于现有后悔界。我们进一步证明当因子化结构对应于若干基 MDP 的笛卡尔积时,DBN-UCRL 的后悔由上界为基 MDP 后悔之和。我们通过标准环境中的数值实验表明,DBN-UCRL 在经验上相比具有频率主义后悔保证的现有算法享有显著改进的后悔。

关键词

引用

@article{arxiv.2009.04575,
  title  = {Improved Exploration in Factored Average-Reward MDPs},
  author = {Mohammad Sadegh Talebi and Anders Jonsson and Odalric-Ambrym Maillard},
  journal= {arXiv preprint arXiv:2009.04575},
  year   = {2021}
}

备注

23 pages. To appear in Proceedings of the 24th International Conference on Artificial Intelligence and Statistics (AISTATS) 2021