中文

赌局与部分可观测马尔可夫决策过程中的路径一致值

最优化与控制 2015-09-09 v2

摘要

在几种标准动态规划模型(赌局、MDP、POMDP)中,我们证明了无限重复问题存在一种非常鲁棒的值概念,即路径一致值。这解决了两个开放问题。首先,这表明对于任意 epsilon>0,决策者有一个纯策略 sigma,只要 n 足够大,该策略在任何 n 阶段博弈中都是 epsilon-最优的(该结果此前仅已知对行为策略成立,即使用随机化的策略)。其次,可以选择策略 sigma,使得在长期平均收益准则(平均收益极限下确界的期望)下,决策者获得大于 lim v(n)-epsilon 的值。

关键词

引用

@article{arxiv.1505.07495,
  title  = {Pathwise uniform value in gambling houses and Partially Observable Markov Decision Processes},
  author = {Xavier Venel and Bruno Ziliotto},
  journal= {arXiv preprint arXiv:1505.07495},
  year   = {2015}
}