使用归一化重要性采样的POMDP策略改进
人工智能
2013-01-14 v1 机器学习
摘要
我们提出了一种从经验中估计部分可观测马尔可夫决策过程(POMDP)期望回报的新方法。该方法不假设对POMDP有任何先验知识,并且允许经验来自任意策略序列。该回报是针对POMDP的任何新策略进行估计的。我们从函数逼近和重要性采样的角度对该估计量进行了推导,并给出了其理论性质。尽管该估计量是有偏的,但方差较小,并且在用于成对比较时,偏差通常无关紧要。最后,我们将该估计量扩展到具有记忆的策略,并在贪婪搜索算法中将其性能与REINFORCE算法进行了比较,结果表明所需试验次数减少了一个数量级。
引用
@article{arxiv.1301.2310,
title = {Policy Improvement for POMDPs Using Normalized Importance Sampling},
author = {Christian R. Shelton},
journal= {arXiv preprint arXiv:1301.2310},
year = {2013}
}
备注
Appears in Proceedings of the Seventeenth Conference on Uncertainty in Artificial Intelligence (UAI2001)