马尔可夫决策过程的最大期望命中代价与奖励的信息量
机器学习
2019-11-06 v2 机器学习
摘要
我们提出马尔可夫决策过程(MDPs)的一种新复杂度度量,即最大期望命中代价(MEHC)。该度量通过考虑奖励结构,收紧了密切相关的时间直径(diameter)概念 [JOA10]。我们证明该参数在扩展 MDP 最优值跨度的上界中替代了直径,从而精炼了若干类 UCRL2 算法的后悔上界。此外,我们证明基于势的奖励塑造 [NHR99] 可诱导具有不同信息量的等价奖励函数,如由 MEHC 所度量。我们进一步确立,在具有有限 MEHC 与未饱和最优平均奖励的一大类 MDP 中,塑造至多可将 MEHC 减小或增大为两倍因子。
引用
@article{arxiv.1907.02114,
title = {Maximum Expected Hitting Cost of a Markov Decision Process and Informativeness of Rewards},
author = {Falcon Z. Dai and Matthew R. Walter},
journal= {arXiv preprint arXiv:1907.02114},
year = {2019}
}
备注
Minor post-review revision. Main paper with appendix. To appear at NeurIPS 2019