Rollout 采样近似策略迭代算法及其界
机器学习
2009-12-30 v2 计算机科学中的逻辑
统计理论
统计理论
摘要
最近提出了几种不使用价值函数的近似策略迭代方案,这些方案专注于使用分类器进行策略表示,并将策略学习视为监督学习问题。利用此类方法寻找优良策略不仅需要合适的分类器,还需要覆盖状态空间的可靠最佳动作样本。迄今为止,关于适当覆盖方案以及降低此类方法样本复杂度的方法(尤其是在连续状态空间中)的研究甚少。本文聚焦于最简单的覆盖方案(状态空间上的离散网格),并对最简单的(且此前常用的)rollout 采样分配策略与一种几乎同样简单但仅需按需分配样本且所需样本显著更少的方法进行了样本复杂度比较。
引用
@article{arxiv.0805.2015,
title = {Algorithms and Bounds for Rollout Sampling Approximate Policy Iteration},
author = {Christos Dimitrakakis and Michail G. Lagoudakis},
journal= {arXiv preprint arXiv:0805.2015},
year = {2009}
}
备注
14 pages, presented at EWRL'08