中文

事后诸葛亮仅五五开:基于 MDP 的近似 POMDP 求解器在多分辨率信息收集中的不适用性

人工智能 2018-04-10 v1

摘要

部分可观测马尔可夫决策过程(POMDPs)为不确定环境下的序贯决策建模提供了一种优雅的框架。在线求解 POMDPs 是一个活跃的研究领域,鉴于真实世界问题的规模,通常使用近似求解器。近来,已有若干方法建议通过结合模仿学习来使用 MDP 求解器求解 POMDPs。基于 MDP 的 POMDP 求解器在某些情形下表现良好,而在其他情形下则灾难性地失败。此类求解器的主要失败点在于 MDP 求解器缺乏获取信息的动机,因为其假设环境要么已被尽可能知晓,要么不确定性将在下一步后消失。然而,对于求解 POMDP 问题,获取信息可带来高效解。本文推导了一组条件,在此条件下基于 MDP 的 POMDP 求解器被证明是次优的。随后我们利用著名的老虎问题来展示此种次优性。我们表明,多分辨率、有预算的信息收集无法使用基于 MDP 的 POMDP 求解器解决。本文的贡献有助于识别那些不宜使用基于 MDP 的 POMDP 求解器的 POMDP 问题的性质,从而支持更好的设计选择。

关键词

引用

@article{arxiv.1804.02573,
  title  = {Hindsight is Only 50/50: Unsuitability of MDP based Approximate POMDP Solvers for Multi-resolution Information Gathering},
  author = {Sankalp Arora and Sanjiban Choudhury and Sebastian Scherer},
  journal= {arXiv preprint arXiv:1804.02573},
  year   = {2018}
}

备注

6 pages, 1 figure