中文

使用值迭代与函数近似的强化学习算法的发散性

机器学习 2012-07-31 v2

摘要

本文给出了在使用函数逼近器近似值函数时,几种主要的强化学习和自适应动态规划算法的值迭代发散实例。这些发散实例与文献中先前的发散实例不同,因为它们适用于贪婪策略,即在“值迭代”场景下。或许令人惊讶的是,在贪婪策略下,TD(1)和Sarsa(1)算法也可能出现发散。除了这些发散情况,我们还实现了自适应动态规划算法HDP、DHP和GDHP的发散。

关键词

引用

@article{arxiv.1107.4606,
  title  = {The Divergence of Reinforcement Learning Algorithms with Value-Iteration and Function Approximation},
  author = {Michael Fairbank and Eduardo Alonso},
  journal= {arXiv preprint arXiv:1107.4606},
  year   = {2012}
}

备注

8 pages, 4 figures. In Proceedings of the IEEE International Joint Conference on Neural Networks, June 2012, Brisbane (IEEE IJCNN 2012), pp. 3070--3077