基于线性函数逼近和优先级扫描的Dyna风格规划
人工智能
2012-06-18 v1 机器学习
系统与控制
摘要
我们考虑在在线设置中高效学习最优控制策略和价值函数的问题,其中状态空间很大,且每次与世界交互后必须提供估计值。本文开发了一种显式的基于模型的方法,将Dyna架构扩展到线性函数逼近。Dyna风格的规划通过从世界模型生成想象经验,然后将无模型强化学习算法应用于想象的状态转换来进行。我们的主要结果是证明,在自然条件下,线性Dyna风格规划收敛到与生成分布无关的唯一解。在策略评估设置中,我们证明极限点是最小二乘(LSTD)解。我们的结果的一个含义是,优先级扫描可以合理地扩展到线性逼近情况,即回溯到前面的特征而不是前面的状态。我们介绍了两种版本的线性Dyna优先级扫描,并在Mountain Car和Boyan Chain问题上简要说明了它们的性能。
引用
@article{arxiv.1206.3285,
title = {Dyna-Style Planning with Linear Function Approximation and Prioritized Sweeping},
author = {Richard S. Sutton and Csaba Szepesvari and Alborz Geramifard and Michael P. Bowling},
journal= {arXiv preprint arXiv:1206.3285},
year = {2012}
}
备注
Appears in Proceedings of the Twenty-Fourth Conference on Uncertainty in Artificial Intelligence (UAI2008)