MDP 中 Almost-sure Energy-MeanPayoff 目标的有限记忆策略
计算机科学与博弈论
2025-10-13 v2
摘要
我们考虑具有组合 Energy-MeanPayoff 目标的有限状态 Markov 决策过程。控制器试图避免能量耗尽,同时在第二个维度上实现严格正的平均收益。我们证明有限记忆足以构成 Energy-MeanPayoff 目标的 almost-sure 获胜策略。这与密切相关的 Energy-Parity 目标形成对比,后者的 almost-sure 获胜策略通常需要无限记忆。我们证明指数记忆对于 almost-sure 获胜 Energy-MeanPayoff 是充分的(即使对于确定性策略)且是必要的(即使对于随机策略)。即使将目标中严格正的平均收益部分推广到多维严格正的平均收益,该上界依然成立。最后,是否存在 almost-sure 获胜策略可在伪多项式时间内判定。
引用
@article{arxiv.2404.14522,
title = {Finite-memory Strategies for Almost-sure Energy-MeanPayoff Objectives in MDPs},
author = {Mohan Dantam and Richard Mayr},
journal= {arXiv preprint arXiv:2404.14522},
year = {2025}
}
备注
36 pages, Full version (incl. appendix) of a paper presented at ICALP 2024. Revision: Updated proof of Lemma 30