如何折扣深度强化学习:迈向新的动态策略
机器学习
2016-01-21 v2 人工智能
摘要
使用深度神经网络作为强化学习任务的函数逼近器最近已被证明对于解决接近真实世界复杂性的问题非常强大。以这些结果作为基准,我们讨论了折扣因子在深度Q网络(DQN)学习过程质量中可能起的作用。当折扣因子逐步增加到其最终值时,我们凭经验表明可以显著减少学习步数。当与变化的学习率结合使用时,我们凭经验表明它在几个实验中优于原始DQN。我们将此现象与神经网络在近似动态规划设置中用作函数逼近器时的不稳定性联系起来。我们还描述了在学习过程中陷入局部最优的可能性,从而将我们的讨论与探索/利用困境联系起来。
引用
@article{arxiv.1512.02011,
title = {How to Discount Deep Reinforcement Learning: Towards New Dynamic Strategies},
author = {Vincent François-Lavet and Raphael Fonteneau and Damien Ernst},
journal= {arXiv preprint arXiv:1512.02011},
year = {2016}
}
备注
NIPS 2015 Deep Reinforcement Learning Workshop