基于分类的近似策略迭代:实验与扩展讨论
机器学习
2014-07-03 v1 系统与控制
最优化与控制
机器学习
摘要
处理大规模近似动态规划或强化学习问题需要能够利用问题内在规律或结构的方法。大多数现有方法倾向于利用值函数或策略的规律。我们引入了一个通用的基于分类的近似策略迭代(CAPI)框架,该框架包含一大类算法,可以根据优势利用值函数和策略空间的规律。该框架有两个主要组件:一个通用值函数估计器和一个基于估计值函数学习策略的分类器。我们为CAPI风格算法的样本复杂度建立了理论保证,允许策略评估步骤由多种算法(包括时间差分风格方法)执行,并能处理策略的非参数表示。我们对性能损失估计误差的界限比现有结果更紧。我们还在几个问题上进行了实证说明,包括一个大型HIV控制任务。
引用
@article{arxiv.1407.0449,
title = {Classification-based Approximate Policy Iteration: Experiments and Extended Discussions},
author = {Amir-massoud Farahmand and Doina Precup and André M. S. Barreto and Mohammad Ghavamzadeh},
journal= {arXiv preprint arXiv:1407.0449},
year = {2014}
}