中文

使用归一化重要性采样的POMDP策略改进

人工智能 2013-01-14 v1 机器学习

摘要

我们提出了一种从经验中估计部分可观测马尔可夫决策过程(POMDP)期望回报的新方法。该方法不假设对POMDP有任何先验知识,并且允许经验来自任意策略序列。该回报是针对POMDP的任何新策略进行估计的。我们从函数逼近和重要性采样的角度对该估计量进行了推导,并给出了其理论性质。尽管该估计量是有偏的,但方差较小,并且在用于成对比较时,偏差通常无关紧要。最后,我们将该估计量扩展到具有记忆的策略,并在贪婪搜索算法中将其性能与REINFORCE算法进行了比较,结果表明所需试验次数减少了一个数量级。

关键词

引用

@article{arxiv.1301.2310,
  title  = {Policy Improvement for POMDPs Using Normalized Importance Sampling},
  author = {Christian R. Shelton},
  journal= {arXiv preprint arXiv:1301.2310},
  year   = {2013}
}

备注

Appears in Proceedings of the Seventeenth Conference on Uncertainty in Artificial Intelligence (UAI2001)