中文

具有部分信息和感知动作域中的重规划

人工智能 2014-01-24 v1

摘要

通过确定化进行重规划是近年来马尔可夫决策过程 (MDP) 中在线规划的一种流行方法。在本文中,我们将这一思想适配到具有部分信息和感知动作的经典非随机域,并提出了一种新的规划器:SDR (Sample, Determinize, Replan)。在每一步,我们生成一个由原始问题诱导的经典规划问题的解计划。只要安全,我们就执行该计划;当不再安全时,我们进行重规划。我们生成的经典规划问题基于 Palacios 和 Geffner 引入的用于一致性规划的基于翻译的方法。该方法中生成的经典规划问题的状态捕捉了原始问题中智能体的信念状态。不幸的是,当此方法应用于带有感知的规划问题时,会产生一个通常非常庞大的非确定性规划问题。我们的主要贡献是引入了状态采样技术以克服这两个问题。此外,我们引入了一种新颖的、惰性的、基于回归的方法,用于在运行时查询智能体的信念状态。我们对该规划器进行了全面的实验评估,表明其在现有基准问题上比最先进的 CLG 规划器具有更好的可扩展性,同时也指出了其在新域中的弱点。我们还讨论了其理论保证。

关键词

引用

@article{arxiv.1401.6048,
  title  = {Replanning in Domains with Partial Information and Sensing Actions},
  author = {Ronen I. Brafman and Guy Shani},
  journal= {arXiv preprint arXiv:1401.6048},
  year   = {2014}
}