非确定性策略改进稳定化近似强化学习
人工智能
2016-12-23 v1 机器学习
机器学习
摘要
本文研究了一类与近似强化学习中贪婪策略改进相关的不稳定性。我们通过实验证明,非确定性策略改进可以通过控制改进的随机性来稳定诸如 LSPI 等方法。此外,我们表明,值函数的合适表示也在一定程度上稳定了解。所提出的方法很简单,并且应该也很容易迁移到诸如深度强化学习等更复杂的算法中。
引用
@article{arxiv.1612.07548,
title = {Non-Deterministic Policy Improvement Stabilizes Approximated Reinforcement Learning},
author = {Wendelin Böhmer and Rong Guo and Klaus Obermayer},
journal= {arXiv preprint arXiv:1612.07548},
year = {2016}
}
备注
This paper has been presented at the 13th European Workshop on Reinforcement Learning (EWRL 2016) on the 3rd and 4th of December 2016 in Barcelona, Spain