中文

利用 Lehmann 精度下界 POMDP 最优策略的新充分条件

系统与控制 2018-10-23 v2

摘要

本文给出了部分可观测马尔可夫决策过程(POMDP)的最优策略能被短视策略下界所约束的新充分条件。所提出的两个条件,即 Lehmann 精度和余正优势,完全修正了 Lovejoy 1987 与 Rieder 1991 著名论文中两个关键假设存在的问题。对于受控感知 POMDP,Lehmann 精度同时利用了值函数的凸性与单调性,而经典的 Blackwell 优势仅利用凸性。文中给出了数值例子,其中 Lehmann 精度成立但 Blackwell 优势不成立,从而说明了主要结果在受控感知应用中的有用性。

关键词

引用

@article{arxiv.1806.08733,
  title  = {New Sufficient Conditions for Lower Bounding the Optimal Policy of a POMDP using Lehmann Precision},
  author = {Vikram Krishnamurthy},
  journal= {arXiv preprint arXiv:1806.08733},
  year   = {2018}
}