中文

可数MDP中点 payoff、平均 payoff 与总 payoff 目标的策略复杂度

计算复杂性 2023-06-22 v4 人工智能 计算机科学与博弈论 概率论

摘要

我们研究具有实值转移奖励的可数无限马尔可夫决策过程(MDPs)。每条无限运行诱导出如下奖励序列:1. 点payoff(直接观测到的转移奖励序列),2. 平均payoff(迄今所有奖励之和除以步数所得的序列),以及3. 总payoff(迄今所有奖励之和的序列)。对于每种payoff类型,目标均为最大化lim inf\liminf非负的概率。我们建立了这些目标的策略复杂度全貌,即ε\varepsilon-最优(分别对应最优)策略所需及充足的记忆量。某些情形可用无记忆确定性策略取胜,而其他情形需要步数计数器、奖励计数器或二者兼具。

关键词

引用

@article{arxiv.2203.07079,
  title  = {Strategy Complexity of Point Payoff, Mean Payoff and Total Payoff Objectives in Countable MDPs},
  author = {Richard Mayr and Eric Munday},
  journal= {arXiv preprint arXiv:2203.07079},
  year   = {2023}
}

备注

arXiv admin note: substantial text overlap with arXiv:2107.03287