可数 MDP 中 Limsup 与 Liminf 阈值目标的策略复杂度及其在最优期望收益中的应用
最优化与控制
2024-09-19 v4 概率论
摘要
我们研究具有可数无限个状态的马尔可夫决策过程(MDP)。(相应地,)阈值目标是指最大化无限直接观测奖励序列的 (相应地,)非负的概率。我们建立了这些目标的策略复杂度的完整图景,即 -最优(相应地,最优)策略所需记忆的上界与下界。随后我们将这些结果应用于解决(Sudderth, Decisions in Economics and Finance, 2020)中关于最优策略在期望 (相应地,)收益上的策略复杂度的两个开放问题。
引用
@article{arxiv.2211.13259,
title = {Strategy Complexity of Limsup and Liminf Threshold Objectives in Countable MDPs, with Applications to Optimal Expected Payoffs},
author = {Richard Mayr and Eric Munday},
journal= {arXiv preprint arXiv:2211.13259},
year = {2024}
}
备注
49 pages