中文

带非马尔可夫奖励的决策理论规划

人工智能 2011-09-13 v1

摘要

在一个奖励取决于历史而不仅仅取决于当前状态的决策过程中,该过程被称为非马尔可夫奖励决策过程(NMRDP)。在决策理论规划中,许多期望行为更自然地被表达为执行序列的属性而非状态的属性,因此 NMRDP 构成了比通常采用的全马尔可夫决策过程(MDP)模型更自然的模型。虽然为 MDP 开发的更易处理的求解方法不能直接应用于存在非马尔可夫奖励的情况,但文献中已经提出了多种 NMRDP 的求解方法。这些方法都利用时序逻辑中非马尔可夫奖励函数的紧凑规范,自动将 NMRDP 转换为等价的 MDP,并使用高效的 MDP 求解方法进行求解。本文提出了 NMRDPP(非马尔可夫奖励决策过程规划器),这是一个用于开发和实验带非马尔可夫奖励的决策理论规划方法的软件平台。当前版本的 NMRDPP 在单一接口下实现了一系列基于现有及新方法的方法族,我们对此进行了详细描述。这些方法包括动态规划、启发式搜索和结构化方法。使用 NMRDPP,我们比较了这些方法,并识别了影响其性能的特定问题特征。NMRDPP 对非马尔可夫奖励的处理受到 TLPlan 规划器中特定领域搜索控制知识处理的启发,并将其作为一种特例纳入其中。在第一届国际概率规划竞赛中,NMRDPP 能够在领域无关和手工编码赛道中竞争并表现良好,在后者中使用了搜索控制知识。

关键词

引用

@article{arxiv.1109.2355,
  title  = {Decision-Theoretic Planning with non-Markovian Rewards},
  author = {C. Gretton and F. Kabanza and D. Price and J. Slaney and S. Thiebaux},
  journal= {arXiv preprint arXiv:1109.2355},
  year   = {2011}
}