中文

MDP 中 Almost-sure Energy-MeanPayoff 目标的有限记忆策略

计算机科学与博弈论 2025-10-13 v2

摘要

我们考虑具有组合 Energy-MeanPayoff 目标的有限状态 Markov 决策过程。控制器试图避免能量耗尽,同时在第二个维度上实现严格正的平均收益。我们证明有限记忆足以构成 Energy-MeanPayoff 目标的 almost-sure 获胜策略。这与密切相关的 Energy-Parity 目标形成对比,后者的 almost-sure 获胜策略通常需要无限记忆。我们证明指数记忆对于 almost-sure 获胜 Energy-MeanPayoff 是充分的(即使对于确定性策略)且是必要的(即使对于随机策略)。即使将目标中严格正的平均收益部分推广到多维严格正的平均收益,该上界依然成立。最后,是否存在 almost-sure 获胜策略可在伪多项式时间内判定。

关键词

引用

@article{arxiv.2404.14522,
  title  = {Finite-memory Strategies for Almost-sure Energy-MeanPayoff Objectives in MDPs},
  author = {Mohan Dantam and Richard Mayr},
  journal= {arXiv preprint arXiv:2404.14522},
  year   = {2025}
}

备注

36 pages, Full version (incl. appendix) of a paper presented at ICALP 2024. Revision: Updated proof of Lemma 30