中文

深度强化学习的浅层更新

人工智能 2017-11-06 v2 机器学习 机器学习

摘要

深度强化学习(DRL)方法,如深度 Q 网络(DQN),已在各种具有挑战性的高维领域中取得了最先进的成果。这一成功主要归功于深度神经网络学习丰富领域表征以逼近价值函数或策略的能力。另一方面,采用线性表征的批量强化学习方法更稳定,且需要更少的超参数调优,但必须进行大量的特征工程才能获得良好结果。在这项工作中,我们提出了一种混合方法——最小二乘深度 Q 网络(LS-DQN),它将 DRL 算法学到的丰富特征表征与线性最小二乘方法的稳定性相结合。我们通过定期使用批量最小二乘更新重新训练 DRL 网络的最后一个隐藏层来实现这一点。我们方法的关键在于为最小二乘更新引入了一个贝叶斯正则化项,以防止对近期数据的过拟合。我们在五款 Atari 游戏上测试了 LS-DQN,并证明其相比原始 DQN 和 Double-DQN 有显著改进。我们还探究了该方法性能优越的原因。有趣的是,我们发现性能提升可归因于 LS 方法在优化最后一层时使用的大批量大小。

关键词

引用

@article{arxiv.1705.07461,
  title  = {Shallow Updates for Deep Reinforcement Learning},
  author = {Nir Levine and Tom Zahavy and Daniel J. Mankowitz and Aviv Tamar and Shie Mannor},
  journal= {arXiv preprint arXiv:1705.07461},
  year   = {2017}
}