有序分支 MDP 的定性多目标可达性
计算机科学与博弈论
2020-08-25 v1 计算机科学中的逻辑
摘要
我们研究有序分支马尔可夫决策过程(OBMDPs),或等价的上下文无关 MDP 的定性多目标可达性问题,建立在分支马尔可夫决策过程(BMDPs)单目标可达性已有结果之上。我们为 OBMDPs 的“几乎必然”与“极限必然”多目标可达性分别提供两种算法。具体而言,给定一个 OBMDP 、一个起始非终结符以及一组大小为 的目标非终结符集合 ,我们的第一个算法判定生成一棵包含集合 中每个目标非终结符的树的上确界概率是否为 。我们的第二个算法判定玩家是否存在一种策略,以几乎必然(概率为 )生成一棵包含集合 中每个目标非终结符的树。需要这两种独立算法:我们表明,在此背景下,多目标可达性的“几乎必然”“极限必然”,即存在这样的 OBMDP,玩家可能没有任何策略能在同一生成树中达到恰好概率为 地到达集合 中所有目标,但可能有一列策略使概率任意接近 。两种算法运行时间为 ,其中 为给定 OBMDP 的总比特编码长度。因此当 固定时它们多项式时间运行,且关于 为固定参数可处理。此外,我们表明即使定性的几乎必然(与极限必然)多目标可达性判定问题,当目标非终结符集合 的大小 不固定时,一般而言是 NP-hard 的。
引用
@article{arxiv.2008.10591,
title = {Qualitative Multi-Objective Reachability for Ordered Branching MDPs},
author = {Kousha Etessami and Emanuel Martinov},
journal= {arXiv preprint arXiv:2008.10591},
year = {2020}
}
备注
47 pages