中文

非确定性策略改进稳定化近似强化学习

人工智能 2016-12-23 v1 机器学习 机器学习

摘要

本文研究了一类与近似强化学习中贪婪策略改进相关的不稳定性。我们通过实验证明,非确定性策略改进可以通过控制改进的随机性来稳定诸如 LSPI 等方法。此外,我们表明,值函数的合适表示也在一定程度上稳定了解。所提出的方法很简单,并且应该也很容易迁移到诸如深度强化学习等更复杂的算法中。

关键词

引用

@article{arxiv.1612.07548,
  title  = {Non-Deterministic Policy Improvement Stabilizes Approximated Reinforcement Learning},
  author = {Wendelin Böhmer and Rong Guo and Klaus Obermayer},
  journal= {arXiv preprint arXiv:1612.07548},
  year   = {2016}
}

备注

This paper has been presented at the 13th European Workshop on Reinforcement Learning (EWRL 2016) on the 3rd and 4th of December 2016 in Barcelona, Spain