中文

可数 MDP 中 Limsup 与 Liminf 阈值目标的策略复杂度及其在最优期望收益中的应用

最优化与控制 2024-09-19 v4 概率论

摘要

我们研究具有可数无限个状态的马尔可夫决策过程(MDP)。lim sup\limsup(相应地,lim inf\liminf)阈值目标是指最大化无限直接观测奖励序列的 lim sup\limsup(相应地,lim inf\liminf)非负的概率。我们建立了这些目标的策略复杂度的完整图景,即 ε\varepsilon-最优(相应地,最优)策略所需记忆的上界与下界。随后我们将这些结果应用于解决(Sudderth, Decisions in Economics and Finance, 2020)中关于最优策略在期望 lim sup\limsup(相应地,lim inf\liminf)收益上的策略复杂度的两个开放问题。

关键词

引用

@article{arxiv.2211.13259,
  title  = {Strategy Complexity of Limsup and Liminf Threshold Objectives in Countable MDPs, with Applications to Optimal Expected Payoffs},
  author = {Richard Mayr and Eric Munday},
  journal= {arXiv preprint arXiv:2211.13259},
  year   = {2024}
}

备注

49 pages