中文

关于带 $L_p$ 不确定性集的折扣型鲁棒 MDP 的复杂度

计算复杂性 2026-05-11 v1

摘要

序贯决策中的基本模型是马尔可夫决策过程(MDP),通过允许转换概率的不确定性并针对不确定性集中的最坏情况转换概率进行优化,将其扩展为鲁棒 MDP(RMDP)。具有 LpL_p 不确定性集的 (s,a)(s, a) 矩形 RMDP 提供了灵活且富有表现力的模型。我们研究具有常数折扣因子的折扣求和准则下的此类 RMDP。是否存在高效算法求解此类问题,是优化和序贯决策中的一个根本性理论问题。先前结果仅为 LL_\infty 不确定性集建立了强多项式时间算法。本文的主要结果如下:(a)我们展示了对于任意紧凑不确定性集,基于 RMDP 的策略迭代算法在获取鲁棒马尔可夫链(RMC)解的 oracle 访问下为强多项式时间;(b)我们给出针对 L1L_1LL_\infty 不确定性集的 RMC 的策略迭代算法的强多项式时间界限;(c)我们最终建立了满足 1<p<1 < p < \infty 的整数 pp 的 RMC 不确定性集的硬性结果。最后,受我们理论界限的启发,我们 presented 实验结果,表明 L1L_1LL_\infty 不确定性集下的 RMDP 策略迭代收敛得很快。

关键词

引用

@article{arxiv.2605.07459,
  title  = {On the Complexity of Discounted Robust MDPs with $L_p$ Uncertainty Sets},
  author = {Ali Asadi and Krishnendu Chatterjee and Alipasha Montaseri and Ali Shafiee},
  journal= {arXiv preprint arXiv:2605.07459},
  year   = {2026}
}