中文

概率最小/最大多项式方程的最大不动点及分支马尔可夫决策过程的可达性

计算复杂性 2016-04-08 v5 计算机科学与博弈论 最优化与控制

摘要

我们给出用于分支马尔可夫决策过程 (BMDPs) 定量(与定性)可达性分析的多项式时间算法。具体而言,给定一个 BMDP 和初始种群,其中控制者的目标是最大化(或最小化)最终达到包含所需(或不需要)类型对象的种群的概率,我们给出在 BMDP 编码大小和 log(1/epsilon) 的多项式时间内,以所需精度 epsilon > 0 逼近上确界(下确界)可达概率的算法。我们进一步给出用于计算可达概率最大化与最小化的 ε-最优策略的 P-时间算法。我们还给出用于所有相关定性分析问题的 P-时间算法,即判定最优(上确界或下确界)可达概率是 0 还是 1。在本文之前,BMDP 最优可达概率的逼近甚至未知是否可判定。我们的算法利用以下基本事实:我们证明对于任意 BMDP,其最大(最小)不可达概率由相应单调最大(最小)概率多项式方程组 (max/min-PPS) x=P(x) 在 [0,1]^n 中的最大不动点 (GFP) 解 g* 给出,该方程组是具不可达目标的 BMDP 的贝尔曼最优方程。我们展示如何在 P-时间内计算 max/min PPS 的 GFP 至所需精度。我们还研究了更一般的分支简单随机博弈 (BSSGs) 及其(不可)达目标。我们证明:(1) 这些博弈的值由相应 max-min PPS 的 GFP 刻画;(2) 逼近该值的定量问题属于 TFNP;(3) 与该值相关的定性问题均可在 P-时间内求解。

关键词

引用

@article{arxiv.1502.05533,
  title  = {Greatest Fixed Points of Probabilistic Min/Max Polynomial Equations, and Reachability for Branching Markov Decision Processes},
  author = {Kousha Etessami and Alistair Stewart and Mihalis Yannakakis},
  journal= {arXiv preprint arXiv:1502.05533},
  year   = {2016}
}