中文

马尔可夫决策过程的最大期望命中代价与奖励的信息量

机器学习 2019-11-06 v2 机器学习

摘要

我们提出马尔可夫决策过程(MDPs)的一种新复杂度度量,即最大期望命中代价(MEHC)。该度量通过考虑奖励结构,收紧了密切相关的时间直径(diameter)概念 [JOA10]。我们证明该参数在扩展 MDP 最优值跨度的上界中替代了直径,从而精炼了若干类 UCRL2 算法的后悔上界。此外,我们证明基于势的奖励塑造 [NHR99] 可诱导具有不同信息量的等价奖励函数,如由 MEHC 所度量。我们进一步确立,在具有有限 MEHC 与未饱和最优平均奖励的一大类 MDP 中,塑造至多可将 MEHC 减小或增大为两倍因子。

关键词

引用

@article{arxiv.1907.02114,
  title  = {Maximum Expected Hitting Cost of a Markov Decision Process and Informativeness of Rewards},
  author = {Falcon Z. Dai and Matthew R. Walter},
  journal= {arXiv preprint arXiv:1907.02114},
  year   = {2019}
}

备注

Minor post-review revision. Main paper with appendix. To appear at NeurIPS 2019