中文

去中心化 POMDP 的最优与近似 Q 值函数

人工智能 2011-11-02 v1

摘要

决策理论规划是处理序贯决策问题的常用方法,因为它以原则化的方式处理感知与动作中的不确定性。在单智能体框架(如 MDP 和 POMDP)中,可以通过借助 Q 值函数来进行规划:通过动态规划以递归方式计算最优 Q 值函数 Q*,然后从 Q* 中提取最优策略。本文研究在去中心化 POMDP 模型(Dec-POMDP)中是否可以定义类似的 Q 值函数,以及如何从这些值函数中提取策略。我们为 Dec-POMDP 定义了两种形式的最优 Q 值函数:一种作为最优纯联合策略的 Q 值函数给出规范性描述,另一种具有序贯理性,从而给出可计算的方案。然而,这种计算除最小规模问题外都是不可行的。因此,我们分析了多种允许高效计算的近似 Q 值函数。我们描述了它们之间的关系,并证明它们都为最优 Q 值函数 Q* 提供了一个上界。最后,在统一若干已有 Dec-POMDP 求解方法的基础上,我们描述了一族用于从此类 Q 值函数中提取策略的算法,并在已有测试问题(包括一个新的消防基准问题)上进行了实验评估。

关键词

引用

@article{arxiv.1111.0062,
  title  = {Optimal and Approximate Q-value Functions for Decentralized POMDPs},
  author = {Frans A. Oliehoek and Matthijs T. J. Spaan and Nikos Vlassis},
  journal= {arXiv preprint arXiv:1111.0062},
  year   = {2011}
}