鲁棒马尔可夫决策过程与二次型度量的复杂性分析
计算机科学中的逻辑
2026-04-30 v1
摘要
鲁棒马尔可夫决策过程(RMDP)扩展了标准马尔可夫决策过程(MDP),以考虑转换概率的不确定性。RMDP具有一个不确定性集合,定义了一组可能的转换函数,每一种都诱导出一个标准MDP。RMDP的自然目标是在不确定性集合中最坏情况的转换函数下优化折扣累积奖励。我们研究了具有半空间表示的RMDP不确定性集合下,相关阈值问题的复杂性。以前的研究聚焦于近似最优或仅关注特定RMDP子类的结果,如区间MDP或-RMDP。我们的贡献有三方面:(1)对于(s,a)矩形RMDP,我们证明鲁棒政策评估通过鲁棒线性规划可解,阈值问题在NP内。作为推论,鲁棒政策迭代在折扣因子固定时是多项式时间算法。(2)对于s矩形RMDP,我们显示阈值问题通过实数的一阶理论可解,位于PSPACE内。(3)我们通过将parity游戏和MDP状态间的二次型度量归约到RMDP阈值问题,建立了下界。一个多项式时间算法可解阈值问题将解决长期以来的开放问题:parity游戏是否可在多项式时间内求解。来自二次型度量的归约还带来了一个实际收益:它允许我们将鲁棒政策迭代作为标准固定点迭代的更高效替代方案,正如我们的实证评估所示。
引用
@article{arxiv.2604.26748,
title = {On the Complexity of Robust Markov Decision Processes and Bisimulation Metrics},
author = {Marnix Suilen and Guillermo A. Pérez},
journal= {arXiv preprint arXiv:2604.26748},
year = {2026}
}