近似修改策略迭代
人工智能
2012-05-21 v2
摘要
修改策略迭代(MPI)是一种动态规划(DP)算法,包含了两种著名的策略迭代和值迭代方法。尽管具有通用性,MPI尚未得到深入研究,尤其是其近似形式——当状态和/或动作空间很大或无限时使用。在本文中,我们提出了近似MPI(AMPI)的三种实现,它们是著名近似DP算法的扩展:拟合值迭代、拟合Q迭代和基于分类的策略迭代。我们提供了误差传播分析,统一了近似策略迭代和值迭代的分析。在最后一种基于分类的实现上,我们进行了有限样本分析,表明MPI的主要参数允许控制分类器的估计误差与整体值函数近似之间的平衡。
引用
@article{arxiv.1205.3054,
title = {Approximate Modified Policy Iteration},
author = {Bruno Scherrer and Victor Gabillon and Mohammad Ghavamzadeh and Matthieu Geist},
journal= {arXiv preprint arXiv:1205.3054},
year = {2012}
}