中文

有序分支 MDP 的定性多目标可达性

计算机科学与博弈论 2020-08-25 v1 计算机科学中的逻辑

摘要

我们研究有序分支马尔可夫决策过程(OBMDPs),或等价的上下文无关 MDP 的定性多目标可达性问题,建立在分支马尔可夫决策过程(BMDPs)单目标可达性已有结果之上。我们为 OBMDPs 的“几乎必然”与“极限必然”多目标可达性分别提供两种算法。具体而言,给定一个 OBMDP A\mathcal{A}、一个起始非终结符以及一组大小为 k=Kk = |K| 的目标非终结符集合 KK,我们的第一个算法判定生成一棵包含集合 KK 中每个目标非终结符的树的上确界概率是否为 11。我们的第二个算法判定玩家是否存在一种策略,以几乎必然(概率为 11)生成一棵包含集合 KK 中每个目标非终结符的树。需要这两种独立算法:我们表明,在此背景下,多目标可达性的“几乎必然”\not=“极限必然”,即存在这样的 OBMDP,玩家可能没有任何策略能在同一生成树中达到恰好概率为 11 地到达集合 KK 中所有目标,但可能有一列策略使概率任意接近 11。两种算法运行时间为 2O(k)AO(1)2^{O(k)} \cdot |\mathcal{A}|^{O(1)},其中 A|\mathcal{A}| 为给定 OBMDP A\mathcal{A} 的总比特编码长度。因此当 kk 固定时它们多项式时间运行,且关于 kk 为固定参数可处理。此外,我们表明即使定性的几乎必然(与极限必然)多目标可达性判定问题,当目标非终结符集合 KK 的大小 kk 不固定时,一般而言是 NP-hard 的。

关键词

引用

@article{arxiv.2008.10591,
  title  = {Qualitative Multi-Objective Reachability for Ordered Branching MDPs},
  author = {Kousha Etessami and Emanuel Martinov},
  journal= {arXiv preprint arXiv:2008.10591},
  year   = {2020}
}

备注

47 pages