可数 MDP 中均值收益、总收益与点收益目标的策略复杂度
人工智能
2021-07-13 v2 概率论
摘要
我们研究具有实值转移奖励的可数无限马尔可夫决策过程(MDP)。每条无限运行诱导出如下收益序列:1. 点收益(直接观测到的转移奖励序列),2. 总收益(迄今所有奖励之和的序列),以及 3. 均值收益。对于每种收益类型,目标均为最大化 非负的概率。我们建立了这些目标的策略复杂度完整图景,即 -最优(相应为最优)策略所需及充足的记忆量。某些情形可用无记忆确定性策略取胜,而其他情形需要步数计数器、奖励计数器或二者兼具。
引用
@article{arxiv.2107.03287,
title = {Strategy Complexity of Mean Payoff, Total Payoff and Point Payoff Objectives in Countable MDPs},
author = {Richard Mayr and Eric Munday},
journal= {arXiv preprint arXiv:2107.03287},
year = {2021}
}
备注
Full version of a conference paper at CONCUR 2021. 41 pages