可数MDP中点 payoff、平均 payoff 与总 payoff 目标的策略复杂度
计算复杂性
2023-06-22 v4 人工智能
计算机科学与博弈论
概率论
摘要
我们研究具有实值转移奖励的可数无限马尔可夫决策过程(MDPs)。每条无限运行诱导出如下奖励序列:1. 点payoff(直接观测到的转移奖励序列),2. 平均payoff(迄今所有奖励之和除以步数所得的序列),以及3. 总payoff(迄今所有奖励之和的序列)。对于每种payoff类型,目标均为最大化非负的概率。我们建立了这些目标的策略复杂度全貌,即-最优(分别对应最优)策略所需及充足的记忆量。某些情形可用无记忆确定性策略取胜,而其他情形需要步数计数器、奖励计数器或二者兼具。
引用
@article{arxiv.2203.07079,
title = {Strategy Complexity of Point Payoff, Mean Payoff and Total Payoff Objectives in Countable MDPs},
author = {Richard Mayr and Eric Munday},
journal= {arXiv preprint arXiv:2203.07079},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2107.03287